מתשובה אחת למסלול שלם
הערכה של מודל-שפה נראתה במשך שנים כמו מבחן פשוט: שולחים הנחיה, מקבלים תשובה ובודקים אותה. פוסט הנדסי של Anthropic מינואר 2026, "Demystifying evals for AI agents", מתאר את המבנה הזה כ"הערכה בסבב יחיד" — הנחיה, תשובה ולוגיקת-ציון — ומסביר למה הוא אינו מספיק לסוכן. סוכן פועל לאורך סבבים רבים: הוא קורא לכלים, משנה את מצב הסביבה ומתאים את עצמו לתוצאות-ביניים, ולכן, בלשון הפוסט, טעויות "יכולות להתפשט ולהצטבר". טעות קטנה בצעד השלישי יכולה לשלוח את כל ההמשך לכיוון אחר, והתשובה הסופית לא תגלה לבודק מה קרה בדרך.
הקושי השני הוא שאין מסלול נכון אחד. בתיאור של מערכת-המחקר מרובת-הסוכנים של Anthropic, שפורסם ביוני 2025, נכתב שגם מאותה נקודת-פתיחה סוכנים עשויים לבחור מסלולים תקינים שונים לגמרי — אחד מחפש בשלושה מקורות ואחר בעשרה — ולכן בדרך-כלל אי-אפשר פשוט לבדוק אם הם ביצעו את הצעדים ה"נכונים" שנקבעו מראש.
הערך הערכת סוכנים באתר מתאר את מבחני-הייחוס הציבוריים שבהם משווים סוכנים, כמו SWE-bench ו-GAIA, ואת השימוש במודל-שפה כשופט. הערך הזה עוסק בשאלה המשלימה: איך בנויה הערכה של משימה שלמה, מההוראה ועד המצב שנוצר בעולם בסופה, כפי שצוותים בונים אותה עבור הסוכן שלהם — ואילו ממדים נמדדים בה מלבד השאלה אם המשימה הצליחה.
המרכיבים: משימה, ניסיון, בודק, תמליל ותוצאה
הפוסט של Anthropic מציע אוצר-מילים שמסדר את התחום. "משימה" היא מבחן בודד עם קלט מוגדר וקריטריון-הצלחה. כל הרצה של משימה היא "ניסיון" (Trial), ומכיוון שהפלט של מודל משתנה מהרצה להרצה, מריצים כמה ניסיונות לכל משימה. "בודק" (Grader) הוא לוגיקה שנותנת ציון להיבט אחד של הביצוע, ולמשימה אחת יכולים להיות כמה בודקים. הפוסט מונה שלושה סוגי בודקים: בודק מבוסס-קוד, שהוא מהיר, זול וניתן לשחזור אך שביר מול פתרונות תקינים שלא נצפו; בודק מבוסס-מודל, גמיש יותר אך לא-דטרמיניסטי ודורש כיול מול בני-אדם; ובודק אנושי, שהוא אמת-המידה אך יקר ואיטי.
שני מושגים נוספים הם לב העניין. "תמליל" (Transcript), שנקרא גם עקבה או מסלול, הוא התיעוד המלא של ניסיון: פלטים, קריאות לכלים, נימוקים ותוצאות-ביניים. "תוצאה" (Outcome) היא המצב הסופי בסביבה בסוף הניסיון. הדוגמה שבפוסט חדה: סוכן להזמנת טיסות יכול לכתוב בסוף התמליל "הטיסה הוזמנה", אבל התוצאה היא השאלה אם ההזמנה אכן קיימת במסד-הנתונים של הסביבה.
הפוסט מבחין גם בין "רתמת הערכה" — התשתית שמריצה משימות במקביל, מתעדת כל צעד, נותנת ציונים ומסכמת — לבין "רתמת הסוכן", המערכת שמאפשרת למודל לפעול כסוכן. ההבחנה חשובה למי שקורא ציונים: לפי הפוסט, מי שמעריך "סוכן" מעריך את הרתמה ואת המודל יחד, ולא את המודל לבדו.
תוצאה מול מסלול: מה בודקים
הנטייה הטבעית היא לבדוק שהסוכן ביצע רצף מסוים של קריאות-כלים בסדר הנכון. הפוסט של Anthropic מדווח שהגישה הזו התבררה כנוקשה מדי ויוצרת מבחנים שבירים, כי סוכנים מוצאים דרכים תקינות שמתכנני המבחן לא צפו, וממליץ לרוב לתת ציון על מה שהסוכן הפיק ולא על הדרך. התיאור של מערכת-המחקר מגיע לאותה מסקנה לגבי סוכנים שמשנים מצב לאורך שיחה ארוכה: להתמקד ב"הערכת מצב-סיום" ולא בניתוח סבב-אחר-סבב, ובזרימות-עבודה מורכבות לחלק את ההערכה לנקודות-ביקורת שבהן אמור להתרחש שינוי-מצב מסוים.
המבחן WebArena, שפורסם ביולי 2023, בנוי על העיקרון הזה: הוא מעמיד לרשות הסוכן אתרים פועלים בארבעה תחומים — מסחר מקוון, פורום, פיתוח-תוכנה משותף וניהול-תוכן — ובודק "נכונות פונקציונלית" של השלמת המשימה. לפי תיאור Anthropic, מבחנים כאלה בודקים גם את מצב מערכת-הרקע, כדי לוודא שהזמנה אכן נקלטה ולא רק שהופיע דף-אישור. במאמר המקורי הסוכן הטוב ביותר שנבדק, מבוסס GPT-4, השלים 14.41 אחוזים מהמשימות, לעומת 78.24 אחוזים אצל בני-אדם — מדידה של אז, מול המודלים של אז.
זה לא אומר שהמסלול חסר-חשיבות. הפוסט ממליץ, אחרי שיש מבחני עבר/נכשל לתוצאה, לבחון גם את התמליל: את איכות הקוד שנכתב, את הדרך שבה הסוכן קורא לכלים ואת האופן שבו הוא מדבר עם המשתמש. הוא ממליץ גם על ניקוד חלקי: סוכן-תמיכה שזיהה את הבעיה ואימת את הלקוח אך לא ביצע את ההחזר טוב יותר מסוכן שנכשל מיד, והציון צריך לשקף את ההבדל.
יותר מהצלחה: פעולות מזיקות, עלות וזמן
בהערכה של משימה שלמה, "הצליח או נכשל" הוא רק ממד אחד. הפוסט של Anthropic מתאר הצלחה רב-ממדית בסוכן-שיחה: האם הפנייה נסגרה (בדיקת-מצב), האם זה קרה בפחות מעשרה סבבים (מגבלה על התמליל), והאם הטון היה הולם (ציון לפי מחוון). בדוגמאות שבפוסט נמדדים לצד הציון גם מספר הסבבים, מספר הקריאות לכלים, סך הטוקנים וזמני-התגובה, ונכתב שעל מאגר-משימות קבוע אפשר לעקוב אחרי השהיה, צריכת טוקנים, עלות-למשימה ושיעורי-שגיאה. הצד הכספי של אותה מדידה מפורט בערך תמחור אמיתי של משימת סוכן.
ממד נפרד הוא פעולות שאסור היה לבצע. המאמר על ToolEmu, שפורסם בספטמבר 2023, יצא מהבעיה שזיהוי סיכונים של סוכנים — כמו דליפת מידע פרטי או הפסד כספי — דורש עבודה ידנית רבה. הפתרון שהציע: מודל-שפה שמדמה את הכלים, ומעריך-בטיחות אוטומטי שבוחן כישלונות ומכמת את הסיכון שבהם. לפי המאמר, 68.8 אחוזים מהכישלונות שזוהו כך נמצאו בבדיקה אנושית ככישלונות שהיו תקפים גם בעולם האמיתי, ועל מערך של 36 כלים רגישים ו-144 מקרי-בדיקה גם הסוכן הבטוח ביותר שנבדק הציג כישלונות כאלה ב-23.9 אחוזים מהמקרים, לפי המעריך של החוקרים.
גם הכיוון ההפוך נמדד. הפוסט ממליץ לבדוק גם מקרים שבהם התנהגות אמורה לקרות וגם מקרים שבהם אסור לה לקרות, ומספר שבבניית הערכות לחיפוש-רשת ב-Claude.ai האתגר היה למנוע חיפוש מיותר בלי לפגוע ביכולת לחפש כשצריך.
התאוששות מטעויות ועקביות בין ניסיונות
משימה ארוכה כמעט תמיד כוללת צעד שמשתבש: כלי שמחזיר שגיאה, חיפוש שלא הניב דבר, הנחה שהתבררה כשגויה. התיאור של מערכת-המחקר של Anthropic מגדיר סוכנים כמערכות שבהן "שגיאות מצטברות", ומדווח שהחברה בנתה אפשרות לחדש ריצה מהנקודה שבה אירעה התקלה במקום להתחיל מההתחלה, ושהודעה לסוכן שכלי מסוים נכשל, יחד עם אפשרות להסתגל, "עובדת טוב באופן מפתיע".
ארגון המחקר METR הציע מדד שניגש לשאלה מכיוון אחר: "אופק-זמן של 50 אחוז", כלומר אורך המשימה — כפי שנמדד אצל אנשי-מקצוע — שמודל משלים בהצלחה בחצי מהמקרים. במאמר שפורסם לראשונה במרץ 2025 מדדו החוקרים למודלים חזיתיים של אז, כמו Claude 3.7 Sonnet, אופק של כ-50 דקות על אוסף המשימות שלהם. לפי ניתוחם, העלייה באופק נובעת בעיקר מאמינות גבוהה יותר ומיכולת להסתגל לטעויות, לצד נימוק ושימוש בכלים טובים יותר. המחברים עצמם מסייגים את המידה שבה הממצאים תקפים מחוץ למשימות שנבדקו.
עקביות היא הצד השני של אותה מטבע. מכיוון שסוכן מתנהג אחרת בכל הרצה, הפוסט של Anthropic מבחין בין pass@k, הסיכוי להצליח לפחות פעם אחת ב-k ניסיונות, לבין pass^k, הסיכוי שכל k הניסיונות יצליחו. בדוגמה שבפוסט, סוכן שמצליח ב-75 אחוזים מהניסיונות יעבור את כל שלושת הניסיונות בסיכוי של כ-42 אחוזים. לדברי הפוסט, המדד השני חשוב במיוחד לסוכנים שפוגשים לקוחות, שמצפים להתנהגות אמינה בכל פעם.
מלכודות במדידה עצמה, ומה משלים אותה
הערכה של משימה שלמה יכולה להיכשל בגלל המבחן ולא בגלל הסוכן. הפוסט של Anthropic מדגיש שכל ניסיון צריך להתחיל מסביבה נקייה: קבצים שנשארו, נתונים שמורים או מחסור במשאבים עלולים ליצור כישלונות מתואמים שמקורם בתשתית. הוא מביא גם דוגמה הפוכה, שבה מצב משותף ניפח ציון: בהערכות פנימיות מסוימות Claude הפיק יתרון לא-הוגן מבדיקת היסטוריית-הגרסאות שהשאירו ניסיונות קודמים.
משימה פגומה היא מלכודת נוספת. לפי הפוסט, אצל מודלים חזיתיים שיעור-הצלחה אפסי לאורך ניסיונות רבים הוא לרוב סימן למשימה שבורה ולא לסוכן חסר-יכולת, ולכן כדאי להכין לכל משימה פתרון-ייחוס שעובר את כל הבודקים. החברה מספרת ש-Claude Opus 4.5 קיבל תחילה 42 אחוזים במבחן CORE-Bench, ואחרי תיקון ליקויים בציון ובמשימות ושימוש ברתמה פחות מגבילה עלה ל-95 אחוזים. זה תיאור של היצרן על מודל שלו (הציון הראשוני פורסם בידי מעריך חיצוני), והוא מובא כאן רק כדי להמחיש כמה ציון יכול להיות תלוי בבודק.
ההמלצה החוזרת היא לקרוא תמלילים: רק כך אפשר לדעת אם הסוכן טעה באמת או שהבודק דחה פתרון תקין. כאן ההערכה נשענת על נצפוּת סוכנים, שמספקת את העקבה של כל צעד. והערכה אוטומטית היא שכבה אחת בלבד: הפוסט מציב לצידה ניטור בסביבת-הייצור, מבחני A/B, משוב-משתמשים, קריאה ידנית של שיחות ומחקרים אנושיים מסודרים, ומשווה את השילוב ל"מודל הגבינה השוויצרית", שבו כל שכבה תופסת חלק ממה שהקודמת החמיצה. כנקודת-התחלה הוא מציע 20 עד 50 משימות פשוטות שנלקחו מכישלונות אמיתיים.