דלג לתוכן

קבוצת מבחן (Test Set)

יסודות בינה מלאכותית

הגדרה

קבוצת מבחן היא מערך-נתונים נפרד לגמרי, שנבדק פעם אחת בסוף כל תהליך הפיתוח — נותן את המדד האמין ביותר לאיכות המודל בעולם האמיתי.

בעוד שקבוצת-האימות נבדקת שוב ושוב תוך כדי פיתוח (ולכן עלולה "לדלוף" מידע על עצמה בעקיפין דרך החלטות-כיוונון), קבוצת-המבחן נשמרת בצד ונבדקת רק פעם אחת, בסוף, כדי לתת הערכה הכי אמינה על ביצועי המודל בפועל.

בעולם מודלי-השפה-הגדולים יש בעיה ייחודית: מכיוון שהם מאומנים על חלקים עצומים מהאינטרנט, קיים סיכון אמיתי ש"קבוצת-המבחן" של בנצ'מארק ציבורי כלשהו כבר הופיעה בטעות בתוך נתוני-האימון עצמם (תופעה שנקראת "זיהום-בנצ'מארק") — מה שהופך את הציון לפחות אמין ממה שהוא נראה. בנצ'מארקים ידועים כמו MMLU (מבחן-ידע רב-תחומי), וכן GSM8K (מבחן-בעיות-חשבון), נבדקו בעצמם למקרי-זיהום כאלה, בדיוק בגלל שהם כה נפוצים ומצוטטים באינטרנט שקשה לוודא שאף חלק מהם לא הגיע במקרה לנתוני-האימון של מודל עתידי.

כדי להתמודד עם הבעיה, חלק מארגוני-המחקר עברו לגישת "בנצ'מארק-חי" (Live Benchmark) — מבחנים שמתעדכנים בשאלות חדשות לגמרי בכל תקופה, כדי שלא יהיה סיכוי שהן כבר הופיעו בנתוני-אימון של מודל שפורסם לפני התאריך הזה. גישה נוספת היא שמירת חלק מהבנצ'מארק כ"סודי" — לא מפרסמים את התשובות הנכונות בפומבי, רק את השאלות, כדי שאי-אפשר יהיה "ללמוד בעל-פה" את התשובה מראש.

ציון על קבוצת-מבחן הוא מה שמדווח בדוחות-מחקר ובבנצ'מארקים ציבוריים — אבל גם הוא לא מבטיח ביצועים מושלמים בעולם האמיתי, שבו הנתונים לעולם לא זהים בדיוק למה שנבדק במעבדה. בגלל זה חברות רבות משלימות ציוני-בנצ'מארק עם הערכה אנושית ישירה על משימות מהעולם האמיתי, ולא מסתמכות רק על מספר יבש. גם השוואה ישירה בין מודלים שונים דורשת זהירות: מודל שמדווח ציון-בנצ'מארק גבוה יותר לא בהכרח "טוב יותר" בפועל למשימה הספציפית של משתמש נתון, אם הבנצ'מארק לא משקף את סוג המשימות שהמשתמש הזה באמת מבצע.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו