קבוצת אימות (Validation Set)
הגדרה
קבוצת אימות היא חלק מהנתונים שנשמר בצד ולא משמש לאימון עצמו — נבדק תוך כדי האימון כדי לוודא שהמודל באמת משתפר, ולא רק משנן.
אם היו בודקים את המודל רק על הנתונים שהוא אומן עליהם, אי אפשר לדעת אם הוא באמת "הבין" את הדפוס או פשוט שינן אותם בעל-פה. קבוצת-אימות פותרת את זה — היא נתונים שהמודל "לא ראה" בזמן האימון.
בפועל, מפתחים בדרך-כלל מחלקים את כל הנתונים הזמינים לשלוש קבוצות נפרדות מראש — למשל 80% לאימון, 10% לאימות ו-10% למבחן (היחסים המדויקים משתנים) — וקבוצת-האימות היא זו שמשמשת "מד-בוחן" תוך-כדי-התהליך, כדי להחליט מתי לעצור או אילו היפר-פרמטרים לשנות.
כשכמות-הנתונים הזמינה מוגבלת ואי-אפשר להרשות לעצמם "לבזבז" 10% קבועים על אימות בלבד, נהוג להשתמש בטכניקה שנקראת "אימות-הצלבה" (Cross-validation) — מחלקים את הנתונים ל-k קבוצות שוות (למשל 5 או 10), ומריצים k סבבי-אימון שונים כשבכל סבב קבוצה אחרת משמשת לאימות והשאר לאימון. כך כל דוגמה בסוף משמשת גם לאימון וגם לאימות, בלי לוותר על שום נתון לצמיתות — יקר יותר חישובית, אבל מדויק יותר כשהנתונים דלים.
לאורך האימון בודקים מדי כמה עידנים איך המודל מתפקד על קבוצת-האימות — אם הביצועים שם מפסיקים להשתפר (או מחמירים) בעוד שהם ממשיכים להשתפר על נתוני-האימון, זה סימן ברור להתאמת-יתר. חשוב לזכור שקבוצת-האימות עצמה, למרות שהמודל לא מאומן עליה ישירות, "מזהמת" בעקיפין את תהליך-הפיתוח — כי מפתחים משנים החלטות-עיצוב על סמך הביצועים שהיא מראה, שוב ושוב, מה שיוצר סיכון-קל שהמודל הסופי מותאם קצת יותר-מדי גם לקבוצה הזו, לא רק לנתוני-האימון — בדיוק הסיבה שקיימת קבוצת-מבחן שלישית, נפרדת לגמרי.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות