למה קשה לתת לסוכן ציון
ההבדל הבסיסי — שסוכן נמדד על השלמת המשימה כולה, ולא על נכונותה של תשובה בודדת — כבר מתואר בערך סוכן בינה מלאכותית, ואין טעם לחזור עליו כאן. הערך הזה עוסק בשאלה שבאה אחריו: איך מודדים את זה בפועל, ולמה זה קשה. שתי מגבלות מעשיות מסבכות את המדידה. הראשונה: יש יותר מדרך נכונה אחת — שני סוכנים יכולים להגיע לאותה תוצאה במסלולים שונים לגמרי, וציון שמעניש על "מסלול לא צפוי" מודד ציות ולא הצלחה. השנייה: הפעולות משפיעות על העולם, ולכן אי-אפשר פשוט להריץ שוב בלי לבנות סביבה מבודדת שאפשר לאפס אותה.
התחושה שהמדידה נשארה מאחור אינה רק תחושה. המאמר שהציג את SWE-bench — מבחן שהוצג ב-2023 על מודלי-שפה, והפך מאז לאחד ממבחני-הסוכנים המרכזיים — נפתח בדיוק שם: "מודלי-שפה עקפו את היכולת שלנו להעריך אותם ביעילות". מאז נכתבו כמה משפחות של מבחנים, וכל אחת מהן מתמודדת עם צלע אחרת של הבעיה — האם המשימה בוצעה, האם הסוכן מסתדר במשימות יומיומיות, והאם הוא עושה זאת שוב ושוב באותה איכות.
מדידה לפי תוצאה: SWE-bench
הצורה הנקייה ביותר של הערכה היא זו שבה קיים מבחן חד-משמעי שאינו תלוי בשיפוט. SWE-bench, שפורסם באוקטובר 2023 תחת הכותרת "האם מודלי-שפה יכולים לפתור תקלות אמיתיות מ-GitHub?", בנוי בדיוק כך: 2,294 בעיות בהנדסת תוכנה שנלקחו מתקלות אמיתיות שדווחו ב-GitHub ומהתיקונים שנעשו להן בפועל, מתוך 12 מאגרי-קוד פופולריים בשפת פייתון. המודל מקבל את מאגר-הקוד ואת תיאור התקלה, ונדרש לערוך את הקוד כדי לפתור אותה.
הציון אינו ניתן על ידי אדם ואינו ניתן על ידי מודל אחר: מריצים את מבחני-התוכנה של הפרויקט עצמו ורואים אם הם עוברים. לפי המאמר, פתרון תקלה כזו "דורש לעיתים קרובות להבין ולתאם שינויים על פני כמה פונקציות, מחלקות ואף קבצים בו-זמנית" — כלומר זו לא משימת-כתיבת-קוד בודדת אלא עבודה שדורשת התמצאות במערכת שלמה. המחברים מדגישים שהמשימה "דורשת ממודלים להתנהל מול סביבות-הרצה, לעבד הקשרים ארוכים במיוחד ולבצע נימוק מורכב, החורג הרבה מעבר למשימות יצירת-קוד מסורתיות". התיאור הזה נכתב על מודלים ולא על סוכנים, אבל הוא מונה בדיוק את התכונות שבגללן המבחן אומץ אחר-כך גם כאמת-מידה מרכזית לסוכנים.
התוצאות בזמן הפרסום ממחישות כמה רחוק היה התחום אז מהמשימה: המודל הטוב ביותר שנבדק, Claude 2, פתר 1.96 אחוזים מהבעיות. המספר הזה השתנה מאז מאוד, והוא מובא כאן כנקודת-הייחוס שבה המבחן נולד ולא כמצב הנוכחי.
מדידה של יכולת יומיומית: GAIA
מבחן אחר, GAIA, שפורסם בנובמבר 2023, ניגש מהכיוון ההפוך. במקום משימות קשות למומחים הוא מציג "שאלות מהעולם האמיתי" שהן, בלשון המאמר, "פשוטות מבחינה רעיונית עבור בני-אדם אך מאתגרות עבור רוב מערכות ה-AI המתקדמות" — שאלות שדורשות נימוק, התמודדות עם כמה סוגי-מדיה, גלישה באינטרנט ושימוש בכלים.
הפער שנמדד הוא כל הנקודה: נבדקים אנושיים הצליחו ב-92 אחוזים מהשאלות, לעומת 15 אחוזים ל-GPT-4 עם תוספים — במדידה של אותו מאמר, מול המודלים שהיו זמינים אז. המאמר מציין שהפער הזה עומד בניגוד למגמה שבה מודלים דווקא עוקפים בני-אדם במשימות שדורשות ידע מקצועי, למשל במשפטים או בכימיה. במילים אחרות, "קשה למודל" ו"קשה לאדם" הם שני סולמות שונים לגמרי, ומבחן שמודד רק את הראשון מפספס בדיוק את מה שמשתמש רגיל מצפה מסוכן.
העמדה שמאחורי המבחן מנוסחת במפורש: המחברים טוענים שהגעה לבינה מלאכותית כללית "תלויה ביכולת של מערכת להפגין חוסן דומה לזה של האדם הממוצע" בשאלות כאלה — ולכן, לשיטתם, הכיוון הנכון אינו מבחנים שקשים לבני-אדם יותר ויותר.
למחברים גם מנגנון מעשי שראוי לשים לב אליו: הם חיברו 466 שאלות, פרסמו את השאלות, ושמרו לעצמם את התשובות ל-300 מהן כדי להפעיל טבלת-דירוג. השארת חלק מהתשובות סגורות היא מענה ל"זיהום-נתונים", בעיה שהערך אמת-מידה מתאר בהרחבה — מבחן שכל תשובותיו פורסמו עלול להיבלע בחומרי-האימון של המודלים הבאים, ואז הוא מודד זיכרון ולא יכולת.
מדידה של עקביות: tau-bench והמדד pass^k
שני המבחנים הקודמים שואלים "האם הסוכן הצליח". המבחן tau-bench (במאמר עצמו הוא נכתב τ-bench), שפורסם ביוני 2024, טוען שזו לא השאלה המלאה. לפי הפתיח שלו, "מבחנים קיימים אינם בודקים סוכני-שפה על האינטראקציה שלהם עם משתמשים אנושיים או על היכולת לציית לכללים ספציפיים-לתחום". סוכן שירות-לקוחות, לפי ההיגיון הזה, אינו נמדד רק על השאלה אם ביטל את ההזמנה, אלא גם על השאלה אם שאל את מה שהנוהל מחייב לשאול לפני שביטל.
לשם כך הציגו מחבריו מדד חדש בשם pass^k, שבודק את אותה משימה על פני כמה ריצות במקום על פני ריצה בודדת. ההבדל מתברר במספרים — במדידה של אותו מאמר, מול המודלים שהיו זמינים אז: סוכנים מתקדמים לקריאת-כלים כמו GPT-4o הצליחו בפחות מ-50 אחוזים מהמשימות, ובמדד pass^8, כלומר על פני שמונה ריצות, הם ירדו אל מתחת ל-25 אחוזים בתחום הקמעונאות.
ההבדל בין שני המספרים האלה הוא בדיוק מה שמשתמש מרגיש בפועל. סוכן שמצליח פעם אחת מכל שתיים הוא הדגמה מרשימה; סוכן שמצליח באופן עקבי בכל שמונה הפעמים הוא משהו שאפשר להעמיד מול לקוחות. המאמר עצמו מסכם שהתוצאות מצביעות על צורך בשיטות שישפרו עקביות וציות-לכללים.
כשאין מבחן חד-משמעי: מודל בתפקיד שופט
רוב המשימות בעולם אינן דומות לתיקון-קוד: אין מבחן שרץ ומכריז "עבר". בסיכום פגישה, בתשובה ללקוח או בטיוטת-מסמך, ההבדל בין טוב ליותר-טוב הוא שיפוט. הפתרון שהתקבע בתעשייה הוא להעמיד מודל-שפה בתפקיד השופט — "מודל-שפה כשופט" (LLM-as-a-Judge): נותנים לו את המשימה ואת שתי התשובות, והוא בוחר.
המאמר שביסס את הגישה, שפורסם ביוני 2023 תחת הכותרת "שופטים את מודל-השפה-כשופט, עם MT-Bench ו-Chatbot Arena", מדד עד כמה השופט המלאכותי מסכים עם בני-אדם, ומצא ששופטים חזקים כמו GPT-4 מגיעים ל"מעל 80 אחוזים הסכמה" עם העדפות אנושיות — "אותה רמת הסכמה שבין בני-אדם לבין עצמם". זו נקודת-ההשוואה החשובה: גם שני אנשים אינם מסכימים זה עם זה יותר מזה.
אותו מאמר מפרט גם את ההטיות שהשיטה סובלת מהן, וזה החלק שנוטים לשכוח: הטיית-מיקום, הטיית-אורך, העדפה-עצמית — נטייה של מודל להעדיף פלט בסגנון של עצמו — ויכולת-נימוק מוגבלת. המחברים מציעים דרכים להקטין את ההטיות האלה, ומנסחים את מה שהשיטה כן נותנת בזהירות: "דרך ניתנת-להרחבה וניתנת-להסבר לקרב את ההעדפות האנושיות". לא תחליף לשיפוט אנושי, אלא קירוב שאפשר להריץ אלפי פעמים ביום. שופט מלאכותי הוא כלי שימושי מאוד, כל עוד זוכרים שגם הוא נמדד, ולא מניחים מראש שהוא צודק.
איך זה מתחבר לשאר, ואיך לקרוא מספרים כאלה
הערכה אינה אירוע חד-פעמי אלא שגרה: אותו מבחן רץ שוב אחרי כל שינוי בהנחיה, בכלים או במודל, כדי לראות אם משהו נשבר בדרך. וכאן שלושת הנושאים נפגשים. כדי לשפוט צריך לדעת מה בעצם קרה, וזה בדיוק מה שנותנת נצפוּת סוכנים — עקבה של כל צעד, ולא רק הפלט הסופי. וכדי שמבחן שרץ על מאות משימות יסתיים בכלל, הריצה עצמה צריכה לשרוד תקלות-תשתית באמצע, וזה מה שנותן ביצוע עמיד.
שתי אזהרות לקורא שנתקל במספרים כאלה במצגת-מכירות. הראשונה: כל מספר הוא מספר של מבחן מסוים, בגרסה מסוימת, בתאריך מסוים — לא "ציון האינטליגנציה" של הסוכן. השנייה, שנובעת ישירות מ-tau-bench: שיעור-הצלחה בלי מדד-עקביות הוא חצי-תמונה, ודווקא החצי המחמיא.
ולבסוף, ההערכה החשובה ביותר אינה אף אחד מהמבחנים הציבוריים האלה, אלא מבחן שנבנה על המשימות שהארגון באמת מריץ, עם קריטריון-הצלחה שהוגדר מראש ובכתב. מבחן ציבורי אומר איפה התחום עומד; רק מבחן פרטי אומר אם הסוכן הזה, במקום הזה, עובד.