הבחינה האחרונה של האנושות (HLE)
הגדרה
מבחן של 2,500 שאלות ברמת מומחה, שפרסמו ב-2025 המרכז לבטיחות AI ו-Scale AI. בטבלה של Scale AI, כפי שנבדקה ב-4 באוקטובר 2026, המודל המוביל ענה נכון על 54.8% מהשאלות.
💡 דוגמה
כותרת מבשרת שמודל חדש "עבר את ה-50 בבחינה האחרונה של האנושות".
לפני שמתרגשים כדאי לבדוק: באיזו גרסה של המבחן, עם חיפוש באינטרנט או בלי, ומי מדד.
למה נבנה מבחן "אחרון"
ב-16 בספטמבר 2024 פרסמו המרכז לבטיחות AI (Center for AI Safety) וחברת Scale AI קריאה עולמית לשלוח להם את השאלות הקשות ביותר שאפשר להציג למכונה. הסיבה הייתה שהמבחנים הקיימים כבר לא הבדילו בין המודלים. דן הנדריקס, מנהל המרכז, אמר ל-Reuters שמודל o1 של OpenAI, שהוצג ימים ספורים קודם, "ריסק את מבחני החשיבה הפופולריים ביותר". במאמר המבחן נכתב שמודלים כבר מגיעים ליותר מ-90% במבחנים מוכרים כמו MMLU.
כדי למשוך מומחים הוצע פרס כולל של 500 אלף דולר: 5,000 דולר לכל אחת מ-50 השאלות הטובות ביותר, ו-500 דולר לכל אחת מ-500 הבאות, וגם אפשרות להופיע כשותף לכתיבת המאמר. שאלות על כלי נשק לא התקבלו.
איך נבחרו השאלות
את השאלות כתבו כמעט אלף מומחים, רובם פרופסורים, חוקרים ובעלי תארים מתקדמים, מיותר מ-500 מוסדות ב-50 מדינות. כל שאלה נבדקה קודם מול כמה מודלים מובילים, והתקבלה לשלב הבא רק אם הם נכשלו בה. 13 אלף שאלות עברו את הסף הזה, ואחרי סבבי ביקורת של מומחים נשארו 2,700 שאלות פומביות ועוד קבוצה סודית. אחרי משוב מהקהילה והסרה של שאלות שאפשר למצוא את תשובתן בחיפוש פשוט, נסגר המבחן באפריל 2025 על 2,500 שאלות.
לכל שאלה יש תשובה אחת ברורה שאפשר לבדוק אוטומטית. לפי Scale AI, 24% מהשאלות הן רב-ברירה, ו-14% דורשות להבין תרשים או איור. את הקבוצה הסודית שומרים כדי לבדוק אם מודלים אומנו על השאלות הפומביות. המאמר פורסם בגרסה מוקדמת בינואר 2025, ובכתב העת Nature ב-28 בינואר 2026.
לא רק כמה נכון, אלא כמה בטוח
המבחן מודד עוד דבר מלבד הדיוק: כיול. המודל מתבקש לתת תשובה וגם להעריך באחוזים עד כמה הוא בטוח בה. מודל מכויל היטב שעונה נכון על מחצית מהשאלות אמור להיות בטוח בממוצע בכ-50%. בפרסום הראשון מצאו המפתחים שגיאת כיול גבוהה מ-80% לצד דיוק נמוך מ-10%, ולדבריהם זו עדות חזקה להזיות: המודלים טעו, והיו בטוחים מאוד בתשובות השגויות.
ביקורת: חלק מהתשובות שגויות
ב-23 ביולי 2025 פרסם ארגון המחקר FutureHouse בדיקה של שאלות הכימיה והביולוגיה שבמבחן. לפי הבדיקה, ל-29% מהשאלות הטקסטואליות בתחומים האלה, בטווח של ±3.7 נקודות אחוז (רווח סמך של 95%), יש תשובות שהספרות המדעית המבוקרת סותרת. החוקרים תלו את הבעיה בשיטה עצמה: כשהתנאי להכנסת שאלה הוא שהמודלים ייכשלו בה, נוצרות שאלות מכשילות, והבודקים לא נדרשו לאמת את הנימוק אם הבדיקה ארכה יותר מחמש דקות. צוות המבחן ערך בדיקה משלו ומצא בעיות בכ-18% ממדגם של שאלות כימיה וביולוגיה.
בפברואר 2026 פרסמו חוקרים מצוות Qwen של עליבאבא את HLE-Verified, גרסה שעברה בדיקה ותיקון: 668 שאלות אומתו כפי שהן, 1,143 תוקנו ואומתו מחדש, ו-689 סומנו כלא ודאיות. לפי החוקרים, הציונים של שמונה מודלים עלו בממוצע ב-7 עד 10 נקודות אחוז בגרסה המתוקנת.
גרסאות חדשות: Rolling ו-Diamond
באוקטובר 2025 השיקו המארגנים את HLE-Rolling, גרסה שמתעדכנת כל הזמן לפי משוב. בעדכון שלה מ-17 בספטמבר 2026 הוחלפו חלק מהשאלות הקלות בשאלות קשות יותר מהקבוצה הסודית, כדי שיהיה לאן לעבור כשהמודלים יתקרבו לתקרת הרעש של המבחן המקורי. ב-22 בספטמבר 2026 פורסמה HLE-Diamond: 1,000 שאלות שעברו ניקוי של כשנה, 500 שאלות חשיבה ו-500 שאלות ידע.
הציונים, תמיד עם תאריך
בהתחלה הציונים היו נמוכים מאוד: לפי הטבלה של Scale AI, GPT-4o ענה נכון על 2.72% מהשאלות, ו-o1 מדצמבר 2024, שגם שימש לסינון השאלות, על 7.96%. באתר המבחן נכתב שייתכן שמודלים יעברו 50% דיוק עד סוף 2025. בטבלה, כפי שנבדקה ב-4 באוקטובר 2026, מוביל GPT-6 Astra של OpenAI עם 54.8%, ואחריו Claude Fable 5.1 עם 46.5% ו-Gemini 3.1 Pro Preview עם 46.44%, ולפי שיטת הדירוג של הטבלה, שמתחשבת בטווח הטעות הסטטיסטי, שניהם מדורגים במקום השני. ליד כל המודלים האלה מופיעה אזהרה: הם נבדקו אחרי פרסום השאלות, כך שלמפתחים הייתה גישה אליהן ולתשובות.
ב-HLE-Diamond, לפי טבלת המארגנים מ-22 בספטמבר 2026, GPT-6 Astra השיג 59.9% בלי כלים ו-82.9% עם חיפוש באינטרנט והרצת קוד, כשכל המודלים נבדקו ברמת חשיבה גבוהה (reasoning high). חברות מפרסמות גם מספרים משלהן, בתנאים שהן בוחרות: וואווי, למשל, מדווחת על 27.1% ל-openPangu-2.0-Pro במצב חשיבה. המארגנים עצמם מזהירים שציון גבוה יעיד על ידע ברמת מומחה בשאלות סגורות, אבל לא יוכיח לבדו יכולת מחקר עצמאית או בינה מלאכותית כללית.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| המבחן המקורי | גרסת Verified | גרסת Diamond | |
|---|---|---|---|
| מי פרסם | המרכז לבטיחות AI ו-Scale AI | חוקרים מצוות Qwen של עליבאבא | המרכז לבטיחות AI ו-Scale AI |
| מתי | ינואר 2025, נסגר באפריל 2025 | פברואר 2026 | 22 בספטמבר 2026 |
| מספר שאלות | 2,500 | 668 מאומתות, 1,143 מתוקנות ו-689 לא ודאיות | 1,000: 500 שאלות חשיבה ו-500 שאלות ידע |
| ציון מוביל מדווח | 54.8% ל-GPT-6 Astra, בטבלת Scale AI (נבדק 4.10.2026) | עלייה ממוצעת של 7 עד 10 נקודות לשמונה מודלים לעומת המקורי | 59.9% ל-GPT-6 Astra בלי כלים |
שאלות נפוצות ❓
מי בנה את המבחן?
המרכז לבטיחות AI (Center for AI Safety) וחברת Scale AI, יחד עם כמעט אלף מומחים מיותר מ-500 מוסדות ב-50 מדינות שכתבו את השאלות.
מה הציון הגבוה ביותר היום?
בטבלה של Scale AI, כפי שנבדקה ב-4 באוקטובר 2026, מוביל GPT-6 Astra של OpenAI עם 54.8%. בגרסה המצומצמת HLE-Diamond הוא השיג 59.9% בלי כלים, לפי נתוני המארגנים מ-22 בספטמבר 2026. ציון כזה מתיישן מהר.
למה מצוטטים לאותו מודל כמה ציונים שונים?
כי יש כמה גרסאות של המבחן: המקורית, HLE-Rolling, HLE-Diamond ו-HLE-Verified. גם תנאי הבדיקה משנים את התוצאה: עם חיפוש באינטרנט והרצת קוד, או בלי.
האם התשובות במבחן תמיד נכונות?
לא תמיד. FutureHouse מצאה שלכ-29% משאלות הכימיה והביולוגיה הטקסטואליות יש תשובות שהספרות המדעית סותרת, וצוות המבחן מצא בעיות בכ-18% ממדגם של שאלות כאלה. לכן נבנו גרסאות מתוקנות.
אם מודל יקבל ציון מלא, זו בינה מלאכותית כללית?
לא, לפי המארגנים. ציון גבוה יראה ידע ברמת מומחה בשאלות סגורות שאפשר לבדוק, אבל לא יוכיח לבדו יכולת לחקור באופן עצמאי או בינה מלאכותית כללית.