מבחן שנבנה למדוד הכללה, לא שינון
המרחק אל בינה מלאכותית כללית הוא מה שהמבחן הזה מנסה למדוד. ARC-AGI הוצג ב-2019 במאמרו של François Chollet, On the Measure of Intelligence. כל משימה היא חידה חזותית: כמה זוגות של רשת-קלט ורשת-פלט צבועות, ועל הפותר להסיק מהדוגמאות המעטות את הכלל ולהחיל אותו על רשת חדשה. שלושת עקרונות התכנון מסבירים למה זה שונה מכל מבחן אחר בקטגוריה: כל משימה חדשה לגמרי, נדרש רק ידע אנושי מולד ובסיסי, וכל אדם רגיל אמור לפתור אותה בלי אימון מיוחד.
87.5 מול 75.7: אותו מודל, שני תקציבי-חישוב
בדצמבר 2024 דיווח ארגון ARC Prize שגרסת-תצוגה של o3 מבית OpenAI קיבלה 75.7 אחוזים בסדרת ההערכה החצי-פרטית של ARC-AGI-1. אותה מערכת בדיוק, בתצורה שצרכה פי 172 חישוב, הגיעה ל-87.5 אחוזים. רק הציון הנמוך יותר עומד בכללי התקציב של המסלול הציבורי, שמגביל את עלות ההרצה לפחות מ-10,000 דולר. שני המספרים מצוטטים לרוב זה לצד זה כאילו הם אותה מדידה — הם אינם. Chollet עצמו כתב באותו פרסום שמעבר ARC-AGI אינו שקול להשגת בינה כללית.
הדור השני איפס כמעט את הציון
ב-24 במרץ 2025 הוצג ARC-AGI-2, שנבנה במפורש נגד השיטות שפתרו את הדור הראשון. הכיול האנושי היה נרחב: 100 אחוזים מהמשימות נפתרו בידי שני נבדקים בלתי-תלויים לפחות מקרב הציבור הרחב; בצבירה לפי משימה הצליחו 75 אחוזים מניסיונות-האדם, ובצבירה על פני כל ההערכות והניסיונות יחד הושלמו 66 אחוזים מזוגות-המבחן. אצל המכונות התמונה התהפכה — אך המספר כאן אינו של גרסת-התצוגה מהסעיף הקודם אלא של o3 שיצא לציבור: לפי טבלת המצב מ-14 במאי 2025, o3 בתצורה בינונית קיבל 53.0 אחוזים ב-ARC-AGI-1 מול 3.0 אחוזים בלבד ב-ARC-AGI-2. ההשוואה כמו-מול-כמו היא 53.0 ל-3.0, ולא 87.5 ל-3.0.
ומה קרה מאז: מ-3 אחוזים ל-95
הפער נסגר מהר. בסיכום תחרות ARC Prize 2025 מ-5 בדצמבר 2025 עמד השיא בקוד-פתוח על 24 אחוזים בעלות של 0.20 דולר למשימה, והמודל המסחרי המאומת המוביל, Opus 4.5, על 37.6 אחוזים בעלות 2.20 דולר למשימה. לפי טבלת התוצאות הרשמית, נכון ל-2 בספטמבר 2026 GPT-6 Astra של OpenAI עומד על 95.0 אחוזים ב-ARC-AGI-2. פרס-הענק של התחרות, 700 אלף דולר, מיועד לצוות הראשון שיעבור 85 אחוזים בסדרה הפרטית בקוד פתוח.
הדור השלישי: משחקים במקום רשתות
ב-25 במרץ 2026 הוצג ARC-AGI-3, מבחן אינטראקטיבי שבו סוכן נדרש לחקור סביבה לא-מוכרת, להסיק בעצמו מה המטרה, ולהשתפר תוך כדי. הקושי היה מיידי: במאי 2026 קיבלו GPT-5.5 ו-Opus 4.7 רק 0.43 ו-0.18 אחוזים בהתאמה. ארבעה חודשים אחר-כך, ב-3 בספטמבר 2026, דיווח ARC Prize ש-GPT-6 Astra הגיע ל-62.7 אחוזים בעלות של 26 אלף דולר.
אותו מודל, שוב שני מספרים
באותה בדיקה קיבל Astra גם 99.9 אחוזים בעלות 19 אלף דולר — אך במעטפת-הרצה אחרת, שמאפשרת למודל לשמר בין קריאות מצב-חשיבה פנימי שאינו גלוי. במעטפת הסטנדרטית הוא רשאי לשמר רק הערות שכתב לעצמו במפורש. ARC Prize מציין שהמעטפת הסטנדרטית היא ההשוואה ההוגנת בין ספקים, ושבתנאים שלה בינה כללית עתידית אמורה לעמוד. זה בדיוק הדפוס של 87.5 מול 75.7 מדצמבר 2024, שנתיים וחצי מאוחר יותר.