ARC-AGI — מבחן חידות-רשת להכללה; כל דור חדש מאפס כמעט את הציון

נתוני AI

הגדרה

מבחן חידות-רשת שמודד פתרון בעיה חדשה ולא ידע שנצבר, ונבנה כמדד בדרך אל בינה מלאכותית כללית; o3 הציבורי קיבל 53.0 אחוזים בדור הראשון ו-3.0 בלבד בדור השני.

מבחן שנבנה למדוד הכללה, לא שינון

המרחק אל בינה מלאכותית כללית הוא מה שהמבחן הזה מנסה למדוד. ARC-AGI הוצג ב-2019 במאמרו של François Chollet, On the Measure of Intelligence. כל משימה היא חידה חזותית: כמה זוגות של רשת-קלט ורשת-פלט צבועות, ועל הפותר להסיק מהדוגמאות המעטות את הכלל ולהחיל אותו על רשת חדשה. שלושת עקרונות התכנון מסבירים למה זה שונה מכל מבחן אחר בקטגוריה: כל משימה חדשה לגמרי, נדרש רק ידע אנושי מולד ובסיסי, וכל אדם רגיל אמור לפתור אותה בלי אימון מיוחד.

87.5 מול 75.7: אותו מודל, שני תקציבי-חישוב

בדצמבר 2024 דיווח ארגון ARC Prize שגרסת-תצוגה של o3 מבית OpenAI קיבלה 75.7 אחוזים בסדרת ההערכה החצי-פרטית של ARC-AGI-1. אותה מערכת בדיוק, בתצורה שצרכה פי 172 חישוב, הגיעה ל-87.5 אחוזים. רק הציון הנמוך יותר עומד בכללי התקציב של המסלול הציבורי, שמגביל את עלות ההרצה לפחות מ-10,000 דולר. שני המספרים מצוטטים לרוב זה לצד זה כאילו הם אותה מדידה — הם אינם. Chollet עצמו כתב באותו פרסום שמעבר ARC-AGI אינו שקול להשגת בינה כללית.

הדור השני איפס כמעט את הציון

ב-24 במרץ 2025 הוצג ARC-AGI-2, שנבנה במפורש נגד השיטות שפתרו את הדור הראשון. הכיול האנושי היה נרחב: 100 אחוזים מהמשימות נפתרו בידי שני נבדקים בלתי-תלויים לפחות מקרב הציבור הרחב; בצבירה לפי משימה הצליחו 75 אחוזים מניסיונות-האדם, ובצבירה על פני כל ההערכות והניסיונות יחד הושלמו 66 אחוזים מזוגות-המבחן. אצל המכונות התמונה התהפכה — אך המספר כאן אינו של גרסת-התצוגה מהסעיף הקודם אלא של o3 שיצא לציבור: לפי טבלת המצב מ-14 במאי 2025, o3 בתצורה בינונית קיבל 53.0 אחוזים ב-ARC-AGI-1 מול 3.0 אחוזים בלבד ב-ARC-AGI-2. ההשוואה כמו-מול-כמו היא 53.0 ל-3.0, ולא 87.5 ל-3.0.

ומה קרה מאז: מ-3 אחוזים ל-95

הפער נסגר מהר. בסיכום תחרות ARC Prize 2025 מ-5 בדצמבר 2025 עמד השיא בקוד-פתוח על 24 אחוזים בעלות של 0.20 דולר למשימה, והמודל המסחרי המאומת המוביל, Opus 4.5, על 37.6 אחוזים בעלות 2.20 דולר למשימה. לפי טבלת התוצאות הרשמית, נכון ל-2 בספטמבר 2026 GPT-6 Astra של OpenAI עומד על 95.0 אחוזים ב-ARC-AGI-2. פרס-הענק של התחרות, 700 אלף דולר, מיועד לצוות הראשון שיעבור 85 אחוזים בסדרה הפרטית בקוד פתוח.

הדור השלישי: משחקים במקום רשתות

ב-25 במרץ 2026 הוצג ARC-AGI-3, מבחן אינטראקטיבי שבו סוכן נדרש לחקור סביבה לא-מוכרת, להסיק בעצמו מה המטרה, ולהשתפר תוך כדי. הקושי היה מיידי: במאי 2026 קיבלו GPT-5.5 ו-Opus 4.7 רק 0.43 ו-0.18 אחוזים בהתאמה. ארבעה חודשים אחר-כך, ב-3 בספטמבר 2026, דיווח ARC Prize ש-GPT-6 Astra הגיע ל-62.7 אחוזים בעלות של 26 אלף דולר.

אותו מודל, שוב שני מספרים

באותה בדיקה קיבל Astra גם 99.9 אחוזים בעלות 19 אלף דולר — אך במעטפת-הרצה אחרת, שמאפשרת למודל לשמר בין קריאות מצב-חשיבה פנימי שאינו גלוי. במעטפת הסטנדרטית הוא רשאי לשמר רק הערות שכתב לעצמו במפורש. ARC Prize מציין שהמעטפת הסטנדרטית היא ההשוואה ההוגנת בין ספקים, ושבתנאים שלה בינה כללית עתידית אמורה לעמוד. זה בדיוק הדפוס של 87.5 מול 75.7 מדצמבר 2024, שנתיים וחצי מאוחר יותר.

שאלות נפוצות ❓

מה בדיוק בודק ARC-AGI?

יכולת להסיק כלל חדש מכמה דוגמאות ולהחיל אותו על מקרה שלא נראה קודם. כל משימה היא חידת רשתות צבועות, המבחן דורש רק ידע אנושי בסיסי, וכל אדם רגיל אמור לפתור אותה ללא אימון מיוחד. הוא הוצג ב-2019 במאמרו של François Chollet.

למה מצוטטים ל-o3 שני ציונים שונים, 87.5 ו-75.7?

כי אלה שתי תצורות של אותה מערכת. 75.7 אחוזים הושגו בתצורה שעומדת בתקרת העלות של המסלול הציבורי, פחות מ-10,000 דולר להרצה; 87.5 אחוזים הושגו בתצורה שצרכה פי 172 חישוב וחורגת מהתקרה. שניהם נמדדו בדצמבר 2024 על ARC-AGI-1.

מה קרה לציונים כשיצא הדור השני של המבחן?

הם קרסו. לפי טבלת המצב מ-14 במאי 2025, o3 בתצורה בינונית — הגרסה שיצאה לציבור, ולא גרסת-התצוגה הפרטית שקיבלה 87.5 — ירד מ-53.0 אחוזים ב-ARC-AGI-1 ל-3.0 אחוזים ב-ARC-AGI-2. ההשוואה כמו-מול-כמו היא 53.0 מול 3.0. בני-אדם, לעומת זאת, פתרו 100 אחוזים מהמשימות: כל משימה נפתרה בידי שני נבדקים בלתי-תלויים לפחות.

מהו הציון הגבוה ביותר ב-ARC-AGI-2 היום?

לפי טבלת התוצאות הרשמית של ARC Prize, נכון ל-2 בספטמבר 2026 GPT-6 Astra של OpenAI עומד על 95.0 אחוזים. לשם השוואה, בדצמבר 2025 עמד המודל המסחרי המאומת המוביל על 37.6 אחוזים בלבד. ציון כזה מתיישן מהר ויש לקרוא אותו עם התאריך שלו.

מה חדש ב-ARC-AGI-3?

הוא אינטראקטיבי: הסוכן מתמודד עם סביבה לא-מוכרת, מזהה בעצמו את המטרה ולומד תוך כדי, במקום לפתור רשת סטטית. במאי 2026 קיבלו בו GPT-5.5 ו-Opus 4.7 פחות מאחוז אחד; בספטמבר 2026 הגיע GPT-6 Astra ל-62.7 אחוזים במעטפת ההרצה הסטנדרטית.