קצב השיפור באמות-המידה (Benchmark Progress Rate)
הגדרה
הדיוק של סוכני AI במבחן OSWorld עלה מכ-12 אחוזים לכ-66.3 אחוזים בתוך שנה, ובמבחן Humanity's Last Exam נוספו 30 נקודות אחוז בשנה אחת.
השאלה שאפשר למדוד
השאלה כמה מהר המודלים משתפרים ניתנת למדידה, ולפי דוח מדד ה-AI של אוניברסיטת סטנפורד ממהדורת 2026 הקצב מהיר במיוחד. הדוח בוחן עשרות אמות-מידה במקביל, ולכן הוא מאפשר לדבר על קצב כלל-תחומי ולא על שיא נקודתי במבחן יחיד. כל הנתונים כאן מתייחסים לשנה שהסתיימה בתחילת 2026, ולכל מספר בהם יש תאריך-תפוגה מעשי.
OSWorld: מ-12 ל-66.3 אחוזים בשנה
במבחן OSWorld, שבודק יכולת של סוכני AI לבצע משימות מחשב במערכות הפעלה שונות, הדיוק עלה מכ-12 אחוזים לכ-66.3 אחוזים בתוך שנה — כשש נקודות אחוז מתחת לביצועי אדם. זו הקפיצה החדה מבין השלוש שמובאות כאן, והיא נוגעת דווקא למשימות מעשיות ולא לשאלות-ידע, כלומר לסוג היכולת שקובע אם סוכן יכול לעבוד בפועל.
שני מבחנים נוספים, אותה תמונה
במבחן Humanity's Last Exam, שנבנה במפורש כדי להיות קשה למכונות ונוח למומחים אנושיים, הוסיפו המודלים החזיתיים 30 נקודות אחוז בשנה אחת. דוגמה שלישית מאותה מהדורה נוגעת לתכנות: הביצועים במבחן SWE-bench Verified, שמעמיד מודלים מול תקלות אמיתיות במאגרי קוד, עלו מכ-60 אחוזים לקרוב למאה אחוזים בתוך שנה אחת. שלוש קפיצות כאלה, בשלושה סוגי משימות שונים לחלוטין, מצביעות על מגמה רחבה ולא על הישג נקודתי במבחן אחד.
רוויה: כשמבחן מפסיק להבחין
הקצב הזה יוצר בעיית מדידה בפני עצמה, שמכונה רוויה: מבחן שמודלים כמעט פותרים במלואו מפסיק להבחין ביניהם, ולכן מפסיק להיות שימושי. הדוח מנסח זאת חד: מבחנים שנועדו להישאר מאתגרים במשך שנים מגיעים לרוויה תוך חודשים, וכך מצטמצם החלון שבו הם מועילים למעקב אחר התקדמות. זו הסיבה שאמות-מידה מוחלפות כל הזמן, ושכמעט לכל מבחן ותיק יש יורש קשה יותר.
התגובה: מבחנים שנבנים מראש נגד רוויה
הדור החדש של אמות-המידה נבנה מתוך הנחה שהוא ייפרץ. ARC-AGI הוא הדוגמה החדה: כשיצא הדור השני שלו ב-2025, מודל שקיבל 53.0 אחוזים בדור הראשון ירד ל-3.0 אחוזים — איפוס כמעט מוחלט של הציון באותה מכונה עצמה. במקביל מזהיר הדוח שהמבחנים עצמם סובלים מבעיות אמינות ומניסיונות מניפולציה: סקירה מצאה ששיעור השאלות הפסולות בתוך המבחנים נע בין 2 אחוזים בתת-מבחן המתמטיקה של MMLU ל-42 אחוזים ב-GSM8K. הפער בין מבחן למבחן הוא הממצא, לא הקצה העליון שלו.
איך לקרוא ציון שמתפרסם
קריאה נכונה של כל ציון דורשת שלושה פרטים ולא אחד: איזה מבחן, באיזה תאריך, ומהו קו-הייחוס האנושי המקביל. ציון של 90 אחוזים במבחן שנרווה אינו אומר שהמודל מצליח ב-90 אחוזים מהמשימות בעולם האמיתי — הוא אומר שהמבחן הזה סיים את תפקידו. מכל סוגי המספרים על תחום הבינה המלאכותית, ציוני אמות-מידה הם המתיישנים ביותר: הם משתנים בקצב של חודשים, לא של שנים, ומבחן שנחשב אתגר רציני בתחילת שנה עשוי להיות פתור עד סופה. וההתקדמות אינה אחידה: באותה מהדורה, בזמן שמודל זכה במדליית זהב באולימפיאדת המתמטיקה הבינלאומית, במבחן ClockBench קרא המודל הטוב ביותר שעון אנלוגי נכון ב-50.6 אחוזים בלבד מהמקרים — מול 90.1 אחוזים אצל בני-אדם.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
שאלות נפוצות ❓
כמה מהר משתפרים המודלים באמות-מידה?
לפי דוח מדד ה-AI של סטנפורד ממהדורת 2026, בשנה אחת: OSWorld עלה מכ-12 לכ-66.3 אחוזים, Humanity's Last Exam הוסיף 30 נקודות אחוז, ו-SWE-bench Verified עלה מכ-60 אחוזים לקרוב למאה. שלושה סוגי משימות שונים, אותה מגמה.
מה זו רוויה של אמת-מידה?
מצב שבו כל המודלים המובילים מגיעים לציון גבוה וקרוב זה לזה, ולכן המבחן כבר אינו מבחין ביניהם ומאבד את תועלתו. הדוח מציין שמבחנים שנועדו להישאר מאתגרים שנים מגיעים לרוויה תוך חודשים.
למה ציון של 90 אחוזים אינו אומר שהמודל מצליח ב-90 אחוזים מהמשימות?
כי הציון מתייחס למבחן מסוים בתאריך מסוים, לא לעולם האמיתי. אם המבחן נרווה, ציון גבוה בו מעיד בעיקר על כך שהמבחן סיים את תפקידו. כל ציון דורש שלושה פרטים: איזה מבחן, מתי, ומה קו-הייחוס האנושי.
האם אפשר לסמוך על אמות-המידה עצמן?
בזהירות. הדוח מציין בעיות אמינות וניסיונות מניפולציה: סקירה מצאה ששיעור השאלות הפסולות בתוך המבחנים עצמם נע בין 2 אחוזים בתת-מבחן המתמטיקה של MMLU ל-42 אחוזים ב-GSM8K — כלומר ההבדל בין מבחן למבחן עצום, ו-42 אינו השיעור הטיפוסי אלא הקצה. לכן עדיף להסתמך על מגמה שנמדדת בכמה מבחנים שונים, ולא על מספר יחיד ממבחן יחיד.
האם השיפור אחיד בכל סוגי המשימות?
לא. אותה מהדורה של הדוח מציינת שבזמן שמודל זכה במדליית זהב באולימפיאדת המתמטיקה הבינלאומית, במבחן ClockBench קרא המודל הטוב ביותר שעון אנלוגי נכון ב-50.6 אחוזים בלבד מהמקרים — מול 90.1 אחוזים אצל בני-אדם. קפיצה באמת-מידה אחת אינה מעידה על יכולת רוחבית.