MMLU — אמת-מידה לידע כללי; בוחן-מומחה מגיע רק ל-89.8 אחוזים

נתוני AI

הגדרה

MMLU היא אמת-מידה למבחן-ידע רב-תחומי מ-2020, הבודקת 57 תחומי-ידע; GPT-4 קיבל בה 86.4 אחוזים במרץ 2023, לפי הדוח הטכני הרשמי של OpenAI.

מבחן-ידע על 57 תחומים, לא מבחן-הנמקה

MMLU (ראשי-תיבות של Massive Multitask Language Understanding) היא אמת-מידה שהציגו חוקרים מברקלי ב-2020, ומטרתה לבדוק כמה ידע עובדתי ומושגי צבר מודל-שפה בזמן האימון שלו — לא כמה טוב הוא מסוגל להסיק או לתכנן. המבחן מורכב מ-15,908 שאלות רב-ברירה (ארבע אפשרויות לכל שאלה) הפרושות על 57 תחומי-ידע נפרדים, מחשבון יסודי ועד משפטים ואתיקה מקצועית — שילוב שנועד לדמות את טווח-הידע שנדרש ממי שסיים תואר ראשון רחב-היקף.

קנה-המידה: מניחוש אקראי ועד מומחיות

כדי לפרש ציון ב-MMLU צריך שלוש נקודות-ייחוס. ניחוש אקראי בין ארבע אפשרויות נותן בממוצע 25 אחוזים. בוחן אנושי לא-מומחה, שנבדק במחקר המקורי, הגיע לכ-34.5 אחוזים בלבד — כלומר רוב השאלות דורשות ידע ספציפי שאין לאדם ממוצע, לא רק היגיון כללי. בוחן-מומחה בתחום הרלוונטי, לעומת זאת, הגיע לכ-89.8 אחוזים — הרף שמודלים מנסים להשיג מאז.

הקפיצה: מ-43.9% ל-86.4% בתוך פחות משלוש שנים

כשהוצג המבחן ב-2020, הדגם החזק ביותר שנבדק — GPT-3 בגרסתו הגדולה ביותר — הגיע ל-43.9 אחוזים בהערכת חמש-דוגמאות (5-shot), כמעט 20 נקודות-אחוז מעל ניחוש אקראי אך רחוק מאוד מרמת-מומחה. ב-14 במרץ 2023 שחררה OpenAI את GPT-4, ולפי הדוח הטכני הרשמי שפרסמה למחרת הוא קיבל 86.4 אחוזים באותה שיטת-הערכה — כמעט כפול מהניקוד של GPT-3, ולראשונה מודל מסחרי התקרב לרמת-הביצוע האנושית-המומחית.

כשמודל "עובר" את בני-האדם: מה בדיוק נמדד

בדצמבר 2023 גוגל הודיעה שהמודל שלה Gemini Ultra הגיע ל-90.0 אחוזים ב-MMLU — לראשונה מודל עבר את סף בוחני-האנוש-המומחים (89.8 אחוזים). אבל השיטה שהובילה לציון הזה שונה מההערכה הרגילה: "שרשרת-מחשבה מכוונת-ודאות" (uncertainty-routed chain-of-thought) עם 32 דגימות לכל שאלה, שבה המודל בוחר את התשובה הנפוצה מבין 32 ניסיונות רק כשהוא בטוח מספיק, ואחרת חוזר לתשובתו הראשונה.

בהערכה הרגילה של 5-shot — אותה שיטה שבה נמדד הציון 86.4 של GPT-4 — Gemini Ultra הגיע רק ל-83.7 אחוזים, נמוך מ-GPT-4. וכש-GPT-4 עצמו נבדק באותה שיטה המתקדמת (32 דגימות מכוונות-ודאות), הוא עלה ל-87.3 אחוזים — עדיין פחות מ-Gemini Ultra, אך לא רחוק. שני המספרים "90.0" ו"86.4" שמופיעים לרוב זה לצד זה בכתבות אינם אותה מדידה בדיוק.

אמת-מידה אחת מתוך משפחה: ההבדל מהמושג הכללי

MMLU הוא מופע ספציפי ומתוארך של המושג הכללי "אמת-מידה" (Benchmark) — מבחן סטנדרטי שמשווה בין מודלים על אותה משימה בדיוק. הערך הזה עוסק בתוצאות בפועל ובמסלול-הציונים ההיסטורי של MMLU עצמו, ולא בשאלה מה זו אמת-מידה באופן כללי או למה יש בה בעיות מובנות — לכך מוקדש ערך נפרד באתר.

רוויה וזיהום-נתונים: הביקורת על MMLU

ככל ש-MMLU הפך לאמת-המידה המצוטטת ביותר בתעשייה, כך גבר גם החשש שחלק משאלותיו הגיעו בטעות לתוך נתוני-האימון של מודלים חדשים — תופעה שנקראת "זיהום-בנצ'מארק" — מה שעלול לנפח ציונים בלי שיפור-יכולת אמיתי. עד 2024 מודלים מובילים כבר הגיעו לציונים גבוהים מאוד וקרובים זה לזה, סימן לרוויה. תגובת קהילת-המחקר: TIGER-Lab פרסמה ביוני 2024 את MMLU-Pro — כ-12,000 שאלות קשות יותר על פני 14 תחומים, עם 10 אפשרויות-תשובה במקום ארבע, כדי לצמצם את הסיכוי לנחש נכון ולסנן שאלות שהתבררו כקלות מדי לכל המודלים.

מסלול הציון ב-MMLU: מניחוש אקראי ועד רף-המומחים
ציוןהערה
ניחוש אקראי (בסיס)25%4 אפשרויות לכל שאלה
בוחן אנושי לא-מומחה (2020)34.5%מחקר המקור
GPT-3 (5-shot)43.9%נמדד ב-2020
בוחן-מומחה (רף-ייחוס)89.8%הרף שמודלים שואפים אליו
GPT-4 (מרץ 2023, 5-shot)86.4%דוח טכני רשמי, OpenAI
GPT-4 (32 דגימות מכוונות-ודאות)87.3%לפי דוח Gemini הטכני
Gemini Ultra (דצמבר 2023, 5-shot)83.7%
Gemini Ultra (32 דגימות מכוונות-ודאות)90.0%השיטה שמעליה הוכרז המעבר על בני-אדם

שאלות נפוצות ❓

כמה שאלות יש ב-MMLU ועל כמה תחומים הן פרושות?

15,908 שאלות רב-ברירה (ארבע אפשרויות כל אחת) על פני 57 תחומי-ידע, ממתמטיקה יסודית ועד משפטים ואתיקה מקצועית — כפי שהוצג במאמר המקורי מ-2020.

מה הציון של GPT-4 ב-MMLU, ומתי הוא נמדד?

86.4 אחוזים, לפי הדוח הטכני הרשמי שפרסמה OpenAI ב-15 במרץ 2023 (יום אחרי שחרור המודל), בהערכת 5-shot הרגילה.

מה ההבדל בין ניחוש אקראי, בוחן אנושי לא-מומחה ובוחן-מומחה ב-MMLU?

ניחוש אקראי נותן 25 אחוזים (ארבע אפשרויות לשאלה); בוחן לא-מומחה הגיע ל-34.5 אחוזים בלבד במחקר המקורי; בוחן-מומחה בתחום הרלוונטי הגיע ל-89.8 אחוזים — הרף שמודלים שואפים אליו.

האם נכון להשוות ישירות בין ציון MMLU של GPT-4 לציון של Gemini Ultra?

רק אם משווים באותה שיטה. בהערכת 5-shot הרגילה GPT-4 מוביל (86.4% מול 83.7%); ב"שרשרת-מחשבה מכוונת-ודאות" עם 32 דגימות — שיטה יקרה ומורכבת בהרבה — Gemini Ultra מוביל (90.0% מול 87.3% ל-GPT-4). המספרים 90.0 ו-86.4 שמצוטטים זה לצד זה בכתבות אינם אותה מדידה.

למה נוצר MMLU-Pro, ומה השתנה בו?

כי עד 2024 מודלים מובילים כבר הגיעו לציונים גבוהים וקרובים זה לזה ב-MMLU המקורי, סימן לרוויה. TIGER-Lab פרסמה ביוני 2024 את MMLU-Pro: כ-12,000 שאלות קשות יותר, 14 תחומים, ו-10 אפשרויות-תשובה במקום ארבע.