קבוצת מבחן (Test Set)
הגדרה
קבוצת מבחן היא מערך-נתונים נפרד לגמרי, שנבדק פעם אחת בסוף כל תהליך הפיתוח — נותן את המדד האמין ביותר לאיכות המודל בעולם האמיתי.
בעוד שקבוצת-האימות נבדקת שוב ושוב תוך כדי פיתוח (ולכן עלולה "לדלוף" מידע על עצמה בעקיפין דרך החלטות-כיוונון), קבוצת-המבחן נשמרת בצד ונבדקת רק פעם אחת, בסוף, כדי לתת הערכה הכי אמינה על ביצועי המודל בפועל.
בעולם מודלי-השפה-הגדולים יש בעיה ייחודית: מכיוון שהם מאומנים על חלקים עצומים מהאינטרנט, קיים סיכון אמיתי ש"קבוצת-המבחן" של בנצ'מארק ציבורי כלשהו כבר הופיעה בטעות בתוך נתוני-האימון עצמם (תופעה שנקראת "זיהום-בנצ'מארק") — מה שהופך את הציון לפחות אמין ממה שהוא נראה. בנצ'מארקים ידועים כמו MMLU (מבחן-ידע רב-תחומי), וכן GSM8K (מבחן-בעיות-חשבון), נבדקו בעצמם למקרי-זיהום כאלה, בדיוק בגלל שהם כה נפוצים ומצוטטים באינטרנט שקשה לוודא שאף חלק מהם לא הגיע במקרה לנתוני-האימון של מודל עתידי.
כדי להתמודד עם הבעיה, חלק מארגוני-המחקר עברו לגישת "בנצ'מארק-חי" (Live Benchmark) — מבחנים שמתעדכנים בשאלות חדשות לגמרי בכל תקופה, כדי שלא יהיה סיכוי שהן כבר הופיעו בנתוני-אימון של מודל שפורסם לפני התאריך הזה. גישה נוספת היא שמירת חלק מהבנצ'מארק כ"סודי" — לא מפרסמים את התשובות הנכונות בפומבי, רק את השאלות, כדי שאי-אפשר יהיה "ללמוד בעל-פה" את התשובה מראש.
ציון על קבוצת-מבחן הוא מה שמדווח בדוחות-מחקר ובבנצ'מארקים ציבוריים — אבל גם הוא לא מבטיח ביצועים מושלמים בעולם האמיתי, שבו הנתונים לעולם לא זהים בדיוק למה שנבדק במעבדה. בגלל זה חברות רבות משלימות ציוני-בנצ'מארק עם הערכה אנושית ישירה על משימות מהעולם האמיתי, ולא מסתמכות רק על מספר יבש. גם השוואה ישירה בין מודלים שונים דורשת זהירות: מודל שמדווח ציון-בנצ'מארק גבוה יותר לא בהכרח "טוב יותר" בפועל למשימה הספציפית של משתמש נתון, אם הבנצ'מארק לא משקף את סוג המשימות שהמשתמש הזה באמת מבצע.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות