מבחן-ידע על 57 תחומים, לא מבחן-הנמקה
MMLU (ראשי-תיבות של Massive Multitask Language Understanding) היא אמת-מידה שהציגו חוקרים מברקלי ב-2020, ומטרתה לבדוק כמה ידע עובדתי ומושגי צבר מודל-שפה בזמן האימון שלו — לא כמה טוב הוא מסוגל להסיק או לתכנן. המבחן מורכב מ-15,908 שאלות רב-ברירה (ארבע אפשרויות לכל שאלה) הפרושות על 57 תחומי-ידע נפרדים, מחשבון יסודי ועד משפטים ואתיקה מקצועית — שילוב שנועד לדמות את טווח-הידע שנדרש ממי שסיים תואר ראשון רחב-היקף.
קנה-המידה: מניחוש אקראי ועד מומחיות
כדי לפרש ציון ב-MMLU צריך שלוש נקודות-ייחוס. ניחוש אקראי בין ארבע אפשרויות נותן בממוצע 25 אחוזים. בוחן אנושי לא-מומחה, שנבדק במחקר המקורי, הגיע לכ-34.5 אחוזים בלבד — כלומר רוב השאלות דורשות ידע ספציפי שאין לאדם ממוצע, לא רק היגיון כללי. בוחן-מומחה בתחום הרלוונטי, לעומת זאת, הגיע לכ-89.8 אחוזים — הרף שמודלים מנסים להשיג מאז.
הקפיצה: מ-43.9% ל-86.4% בתוך פחות משלוש שנים
כשהוצג המבחן ב-2020, הדגם החזק ביותר שנבדק — GPT-3 בגרסתו הגדולה ביותר — הגיע ל-43.9 אחוזים בהערכת חמש-דוגמאות (5-shot), כמעט 20 נקודות-אחוז מעל ניחוש אקראי אך רחוק מאוד מרמת-מומחה. ב-14 במרץ 2023 שחררה OpenAI את GPT-4, ולפי הדוח הטכני הרשמי שפרסמה למחרת הוא קיבל 86.4 אחוזים באותה שיטת-הערכה — כמעט כפול מהניקוד של GPT-3, ולראשונה מודל מסחרי התקרב לרמת-הביצוע האנושית-המומחית.
כשמודל "עובר" את בני-האדם: מה בדיוק נמדד
בדצמבר 2023 גוגל הודיעה שהמודל שלה Gemini Ultra הגיע ל-90.0 אחוזים ב-MMLU — לראשונה מודל עבר את סף בוחני-האנוש-המומחים (89.8 אחוזים). אבל השיטה שהובילה לציון הזה שונה מההערכה הרגילה: "שרשרת-מחשבה מכוונת-ודאות" (uncertainty-routed chain-of-thought) עם 32 דגימות לכל שאלה, שבה המודל בוחר את התשובה הנפוצה מבין 32 ניסיונות רק כשהוא בטוח מספיק, ואחרת חוזר לתשובתו הראשונה.
בהערכה הרגילה של 5-shot — אותה שיטה שבה נמדד הציון 86.4 של GPT-4 — Gemini Ultra הגיע רק ל-83.7 אחוזים, נמוך מ-GPT-4. וכש-GPT-4 עצמו נבדק באותה שיטה המתקדמת (32 דגימות מכוונות-ודאות), הוא עלה ל-87.3 אחוזים — עדיין פחות מ-Gemini Ultra, אך לא רחוק. שני המספרים "90.0" ו"86.4" שמופיעים לרוב זה לצד זה בכתבות אינם אותה מדידה בדיוק.
אמת-מידה אחת מתוך משפחה: ההבדל מהמושג הכללי
MMLU הוא מופע ספציפי ומתוארך של המושג הכללי "אמת-מידה" (Benchmark) — מבחן סטנדרטי שמשווה בין מודלים על אותה משימה בדיוק. הערך הזה עוסק בתוצאות בפועל ובמסלול-הציונים ההיסטורי של MMLU עצמו, ולא בשאלה מה זו אמת-מידה באופן כללי או למה יש בה בעיות מובנות — לכך מוקדש ערך נפרד באתר.
רוויה וזיהום-נתונים: הביקורת על MMLU
ככל ש-MMLU הפך לאמת-המידה המצוטטת ביותר בתעשייה, כך גבר גם החשש שחלק משאלותיו הגיעו בטעות לתוך נתוני-האימון של מודלים חדשים — תופעה שנקראת "זיהום-בנצ'מארק" — מה שעלול לנפח ציונים בלי שיפור-יכולת אמיתי. עד 2024 מודלים מובילים כבר הגיעו לציונים גבוהים מאוד וקרובים זה לזה, סימן לרוויה. תגובת קהילת-המחקר: TIGER-Lab פרסמה ביוני 2024 את MMLU-Pro — כ-12,000 שאלות קשות יותר על פני 14 תחומים, עם 10 אפשרויות-תשובה במקום ארבע, כדי לצמצם את הסיכוי לנחש נכון ולסנן שאלות שהתבררו כקלות מדי לכל המודלים.