דלג לתוכן

הערכת מודלים

יסודות בינה מלאכותית

הגדרה

הערכת מודלים היא הדרך לבדוק כמה טוב מודל בינה מלאכותית באמת: במה, לעומת מה ולפי איזה מדד. היא נשענת על נתונים שהמודל לא ראה, על מבחנים משותפים, על שיפוט אנושי ועל בדיקות סיכונים.

💡 דוגמה

חנות אונליין בוחרת בין שני צ'טבוטים לשירות לקוחות. לאחד ציון גבוה יותר בטבלה ציבורית.

אבל כשהצוות מריץ את שניהם על מאה שאלות אמיתיות של לקוחות מהחודש האחרון, השני עונה טוב יותר.

מה זה, ואיפה עוברים הגבולות

כשאומרים שמודל "מדויק", "הוגן" או "בטוח", מאחורי המילה עומדת הערכה: מישהו הריץ את המודל על נתונים מסוימים ומדד את התוצאה בדרך מסוימת. הערכת מודלים (Model Evaluation) היא השם הכללי לכל הפעולות האלה. היא שואלת שלוש שאלות: במה בודקים, לעומת מה משווים, ומה בדיוק נחשב הצלחה. חברת Anthropic, שמפתחת את מודלי Claude, כתבה ב-2023 שאנשים רבים, בתוך התחום ומחוצה לו, לא מבינים עד כמה קשה לבנות הערכות חזקות ואמינות, ושרבות מחבילות ההערכה הקיימות מוגבלות ביכולתן לשמש מדד מדויק ליכולות או לבטיחות של מודל.

הערך הזה הוא מבט-על, ולכל חלק בו יש באתר ערך משלו: קבוצת אימות וקבוצת מבחן, מטריצת בלבול, דיוק-חיובי, היזכרות וציון F1, אמת-מידה (Benchmark) וזיהום אמות מידה, מודל שפה כשופט, הערכת סוכנים, הערכת מודלי שפה בעברית ובדיקות פריצה יזומות.

הכלל הראשון: לבדוק על מה שהמודל לא ראה

ספריית scikit-learn, מהכלים הנפוצים ללמידת מכונה, פותחת את הפרק שלה על הנושא במשפט: ללמוד את הפרמטרים של מודל ולבדוק אותו על אותם נתונים זו "טעות מתודולוגית". מודל שפשוט חוזר על התשובות שראה יקבל ציון מושלם, ולא יצליח לחזות שום דבר על נתונים חדשים. לכן מחלקים את הנתונים. מדריך למידת המכונה של Google ממליץ על שלוש קבוצות: קבוצת אימון, קבוצת אימות שמשמשת לבדיקות במהלך הפיתוח, וקבוצת מבחן שמשמשת לבדיקה כפולה בסוף.

המדריך מזהיר שגם קבוצות האימות והמבחן "נשחקות" בשימוש חוזר. מי שבודק שוב ושוב על אותה קבוצה ומתקן את המודל לפי התוצאות, מתאים אותו בלי כוונה לקבוצה הזו, כמו מורה ש"מלמד לקראת המבחן". כשיש מעט נתונים, משתמשים באימות צולב: לפי scikit-learn, מחלקים את נתוני האימון לכמה חלקים, מאמנים בכל פעם על כולם חוץ מאחד ובודקים על החלק שנשאר בחוץ, ושומרים קבוצת מבחן נפרדת לבדיקה הסופית.

לעומת מה: קו בסיס ומדד נכון

ציון לבדו לא אומר הרבה. scikit-learn ממליצה על בדיקת שפיות פשוטה: להשוות את המודל לכללי בסיס פשוטים, למשל "תמיד לנחש את התשובה הנפוצה ביותר". בדוגמה בתיעוד שלה, מודל אחד הגיע לדיוק של 0.63, ומסווג שתמיד ניחש את הקבוצה הנפוצה הגיע ל-0.579. כשהחליפו את פונקציית הגרעין של אותו מסווג, הדיוק עלה ל-0.94. המסקנה של התיעוד: כשהדיוק קרוב מדי לאקראי, כנראה משהו השתבש.

גם בחירת המדד חשובה. כשקבוצה אחת נדירה מאוד, דיוק כללי עלול לנפח את הביצועים, ולכן scikit-learn מציעה מדדים כמו "דיוק מאוזן", שנועד בדיוק למנוע הערכות-יתר כאלה, ולצידו מדדים כמו דיוק-חיובי והיזכרות. מודל שמזהה הונאות בכרטיסי אשראי, למשל, יכול "לצדוק" כמעט תמיד אם יגיד שאף עסקה אינה הונאה, ועדיין להיות חסר תועלת.

מדד אחד לא מספיק

במודלי שפה הבעיה מתרחבת, כי מודל שפה אחד עשוי לשמש למגוון רחב של משימות. פרויקט HELM של אוניברסיטת סטנפורד, שפורסם בנובמבר 2022, ניסה לסדר את התמונה. החוקרים מדדו שבעה מדדים — דיוק, כיול, חוסן, הוגנות, הטיה, רעילות ויעילות — על 16 תרחישי ליבה, ככל שהיה אפשר, ובדקו 30 מודלים. הם מצאו שלפני הפרויקט נבדקו מודלים, בממוצע, רק על 17.9% מתרחישי הליבה, ושחלק מהמודלים הבולטים לא חלקו אפילו תרחיש אחד משותף. הכיסוי החלקי, ובחלק מהמקרים היעדר מבחנים משותפים, הקשו על השוואה שיטתית בין מודלים.

לפי Anthropic, יש גם מתח בין מדדים. מערכת יכולה להימנע מתשובות מזיקות אם תענה על הכול "סליחה, אני לא יכול לעזור בזה", ולכן מודדים גם עזרה וגם הימנעות מנזק. החברה מספרת שכאשר מדדה הטיה חברתית במבחן BBQ, חלק מהמודלים שלה קיבלו ציון 0, כלומר ללא הטיה. בדיקה פשוטה הראתה שהם פשוט לא ענו על השאלות. לדבריה, כל הערכה חשופה לכשל הזה: לפרש את המספר יותר מדי ולשכנע את עצמך שהתקדמת.

מי נותן את הציון

יש כמה דרכים לתת ציון, ולכל אחת מחיר. מבחנים עם מפתח תשובות, כמו שאלות אמריקאיות, אפשר לבדוק אוטומטית, וכך בנויים מבחנים נפוצים כמו MMLU. כשאין תשובה אחת נכונה, פונים לבני אדם. Anthropic מתארת ניסויים שבהם אנשים משוחחים עם שני מודלים ובוחרים איזו תשובה מועילה יותר. השיטה קרובה לשימוש אמיתי, אבל לפי החברה היא יקרה, איטית, ותלויה מאוד במי ששופט.

פלטפורמת Chatbot Arena, שנקראה אחר כך LMArena ומינואר 2026 נקראת פשוט Arena, הרחיבה את הרעיון להמונים: משתמשים משווים בין תשובות של שני מודלים, ובמאמר שפורסם במרץ 2024 דיווחו מפעיליה על יותר מ-240 אלף הצבעות ועל הסכמה טובה בין קולות הקהל לשיפוט של מומחים. אפשר גם לתת למודל אחר לשפוט, כפי שמפורט בערך מודל שפה כשופט. ומודלים יכולים גם לכתוב את המבחנים עצמם: Anthropic כתבה שמודלים מייצרים מבחנים חדשים בתוך דקות, במקום ימים או חודשים, אבל שעדיין צריך בני אדם כדי לוודא שהמבחנים האלה נכונים.

למה ציון יכול להטעות

Anthropic פירטה כמה בעיות שמצאה ב-MMLU, אחד ממבחני הידע הנפוצים. מאחר שהוא נפוץ כל כך, סביר יותר שהשאלות שלו הגיעו לנתוני האימון, "כמו תלמידים שראו את השאלות לפני המבחן". שינויי עיצוב קטנים, כמו החלפת (A) ב-(1), שינו את הדיוק בכ-5%. מעבדות שונות מריצות את המבחן בדרכים שונות, חלקן בשיטות שמעלות את הציון, ולכן צריך זהירות רבה בהשוואה בין ציונים של חברות שונות. ובמבחן עצמו נמצאו שאלות עם תשובה מסומנת שגויה או שאין להן תשובה.

מעל כל אלה עומד חוק גודהארט, בניסוח הידוע שלו: "כאשר מדד הופך למטרה, הוא מפסיק להיות מדד טוב". דוגמה לתמריץ בעייתי כזה מציג מאמר מספטמבר 2025 של אדם טאומן קלאי ועמיתיו, שטוען ששיטות ההערכה הן אחת הסיבות לכך שמודלי שפה ממציאים עובדות. לפי המאמר, הדרך שבה מנקדים את רוב המבחנים מענישה תשובות שמודות באי-ודאות, ולכן ניחוש משפר את הציון: המודלים עוברים אופטימיזציה להיות "נבחנים טובים". הפתרון שהם מציעים אינו מבחן הזיות נוסף, אלא שינוי שיטת הניקוד של המבחנים הקיימים שמובילים את טבלאות הדירוג.

הערכת סיכונים: לא רק כמה טוב, אלא מה הוא מסוגל לעשות

ענף נפרד של הערכה בודק יכולות מסוכנות. כאן לא שואלים אם המודל עונה נכון, אלא אם אפשר לגרום לו לעזור במשהו מזיק. Anthropic מתארת עבודה עם מומחים בתחומי ביטחון לאומי, שמנסים לחלץ מהמודל מידע מסוכן לפי תרחישי איום שהוגדרו מראש, ומודה ש"בדיקות פריצה יזומות הן כיום יותר אמנות ממדע". היא תיארה גם ביקורת חיצונית שערך מרכז המחקר ARC (Alignment Research Center), שבדק אם מודל מסוגל, למשל, לצבור משאבים, ליצור עותקים של עצמו או להקשות על כיבויו.

לפי החברה, גם ביקורת חיצונית לא פשוטה: הבודקים שומרים פרטים לעצמם כדי לשמור על אמינות הבדיקה, אבל בלי להכיר את פרטי הביקורת קשה לחברה הנבדקת לעזור להם למצות את יכולות המודל. ההמלצה שלה לממשלות הייתה להשקיע במדע של הערכה עצמו, ולהעדיף מבחן אחד איכותי על פני עשרה חלשים.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

ארבעה מרכיבים בהערכת מודלים (לעיתים הם חופפים)
קבוצת אימותקבוצת מבחןאמת-מידה ציבוריתהשוואה בידי בני אדם
מה זהחלק מהנתונים שנשמר בצד לבדיקות במהלך הפיתוחחלק מהנתונים שנשמר לבדיקה האחרונהמבחן משותף שאפשר להעריך בו מודלים שוניםאנשים בוחרים איזו משתי תשובות טובה יותר
למה הוא טובמאפשר לכוונן את המודל בלי לגעת במבחןנותן הערכה מהימנה יותר ליכולת על נתונים חדשיםמאפשר להשוות בין מודלים של חברות שונותקרוב לשימוש אמיתי, גם כשאין תשובה אחת נכונה
החולשה העיקריתנשחקת בשימוש חוזרגם היא נשחקת אם בודקים עליה שוב ושובשאלות עלולות להיכלל בנתוני האימון, ופרטי הרצה משנים את הציוןיקרה, איטית ותלויה במי ששופט

שאלות נפוצות ❓

מה ההבדל בין הערכת מודלים לבין אמת-מידה (Benchmark)?

אמת-מידה היא כלי אחד בתוך ההערכה: מבחן משותף שמאפשר להשוות בין מודלים. הערכת מודלים רחבה יותר, וכוללת גם את חלוקת הנתונים בזמן הפיתוח, בחירת מדדים וקו בסיס, שיפוט אנושי ובדיקות סיכונים.

למה לא בודקים מודל על הנתונים שעליהם הוא אומן?

כי מודל שפשוט זוכר את התשובות יקבל ציון מושלם בלי שהוכיח יכולת להתמודד עם נתונים חדשים. scikit-learn מגדירה את זה "טעות מתודולוגית". לכן שומרים בצד קבוצת אימות וקבוצת מבחן, ובודקים עליהן.

אפשר לסמוך על טבלאות הדירוג של מודלי שפה?

כנקודת פתיחה. לפי Anthropic, שינויי עיצוב קטנים במבחן MMLU שינו את הדיוק בכ-5%, ומעבדות מריצות אותו בדרכים שונות, כך שהשוואה בין ציונים של חברות שונות דורשת זהירות. כדאי לבדוק גם על המשימה שלכם.

איך שיטת הבדיקה קשורה להזיות של מודלים?

לפי מאמר של קלאי ועמיתיו מ-2025, שיטת הניקוד של רוב המבחנים מענישה תשובות שמודות באי-ודאות, ולכן מודל שמנחש מקבל ציון גבוה יותר. הכותבים מציעים לשנות את שיטת הניקוד של המבחנים הקיימים.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו