מודל שפה כשופט (LLM-as-a-Judge)
הגדרה
מודל שפה כשופט היא שיטה שבה מודל שפה גדול מעריך תשובות של מודלים אחרים, או את התשובות שלו עצמו, במקום בודקים אנושיים. היא זולה ומהירה, אבל לשופט יש הטיות משלו.
💡 דוגמה
חברת ביטוח בונה צ'טבוט שעונה ללקוחות. במקום שעובדים יקראו אלפי תשובות, מודל אחר בודק כל תשובה ומסמן את אלה שנשמעות לא מנומסות או לא מדויקות.
מה זה, ולמה צריך את זה
כשמפתחים צ'טבוט, סוכן או כל מוצר שמבוסס על מודל שפה, צריך לדעת אם התשובות טובות. בשאלות אמריקאיות קל לבדוק, אבל רוב התשובות של מודל שפה הן טקסט חופשי: סיכום, מכתב, הסבר. בדיקה אנושית איטית ויקרה, ומדדים אוטומטיים ותיקים כמו BLEU ו-ROUGE, שסופרים חפיפת מילים מול תשובת דוגמה, מתאימים פחות: לפי מחקר מ-2023, המתאם שלהם עם שיפוט אנושי חלש יחסית, במיוחד במשימות יצירתיות. הפתרון שהשתרש: לתת למודל שפה חזק לשפוט. מנסחים לו את המשימה, את התשובה ואת אמות המידה, והוא מחזיר ציון או בחירה, ולעיתים גם נימוק.
המאמר שנתן לשיטה את שמה
ביוני 2023 פרסמה קבוצת חוקרים, בהם ליאנמין ג'נג ויון סטויקה, מאמר בשם "שופטים את מודל-השפה-כשופט". הם בנו שני מבחנים: MT-Bench, סט שאלות של שיחה מרובת סבבים, ו-Chatbot Arena, זירה שבה גולשים מעמידים שני מודלים זה מול זה ובוחרים את התשובה הטובה. התוצאה: שופטים חזקים כמו GPT-4 הגיעו ל"מעל 80% הסכמה" עם העדפות של בני אדם, "אותה רמת הסכמה שיש בין בני אדם לבין עצמם". המסקנה של המחברים הייתה זהירה: זו דרך ניתנת להרחבה ולהסבר "לקרב" העדפות אנושיות, שאחרת יקר מאוד לאסוף. הם גם פרסמו לציבור את שאלות MT-Bench, כ-3,000 הצבעות של מומחים וכ-30 אלף שיחות עם העדפות אנושיות, כדי שאחרים יוכלו לבדוק את השופטים שלהם.
איך מעמידים שופט
בפועל יש כמה צורות עבודה עיקריות. בהשוואה בזוגות נותנים לשופט שתי תשובות לאותה שאלה ושואלים איזו טובה יותר. בציון ישיר השופט מקבל תשובה אחת ומדרג אותה לפי קריטריון שהוגדר, כמו בהירות או נימוס. בהערכה מול מקור מוסיפים לו חומר עזר, כמו תשובה נכונה לדוגמה או המסמכים שמהם התשובה הייתה אמורה לשאוב, והוא בודק אם התשובה נאמנה להם. מחקר G-Eval מ-2023 הראה שכדאי לבקש מהשופט לחשוב שלב אחר שלב ולמלא טופס של קריטריונים, במשימת סיכום הגיעה השיטה, עם GPT-4, למתאם של 0.514 עם שיפוט אנושי, גבוה משל כל השיטות שקדמו לה.
ההטיות של השופט
כבר במאמר של 2023 זוהו בעיות. הטיית מיקום: שופט שנוטה להעדיף את התשובה שהוצגה ראשונה (או שנייה) בלי קשר לתוכן. הטיית אורך: העדפה של תשובות ארוכות ומפורטות, גם כשהן לא טובות יותר. והעדפה עצמית: שופט שמעדיף תשובות שנשמעות כמו שלו. מחקר מאפריל 2024 הראה ש-GPT-4 ו-Llama 2 מצליחים במידה לא מבוטלת לזהות טקסטים שהם עצמם כתבו, ושככל שהיכולת הזו חזקה יותר, ההעדפה העצמית חזקה יותר. גם ב-G-Eval הזהירו החוקרים שהשופטים נוטים להעדיף טקסט שנכתב בידי מודל על פני טקסט אנושי.
איך מקטינים את הנזק
מחקר מאפריל 2024 על AlpacaEval, מבחן שבו מודל שופט מדרג תשובות, הראה שאפשר לנטרל סטטיסטית את הטיית האורך. החוקרים שאלו מה היה השופט מעדיף אילו שתי התשובות היו באורך זהה, ואחרי התיקון עלה המתאם של הדירוג עם הדירוג האנושי של Chatbot Arena מ-0.94 ל-0.98. בצד המעשי, מדריכים בתחום ממליצים לנסח קריטריונים מפורשים, להעדיף שאלות של כן/לא על פני סולם ציונים, לבקש נימוק, ובעיקר לבדוק את השופט עצמו מול סט קטן של דוגמאות שבני אדם תייגו.
דרך נוספת היא שופט פתוח וייעודי. מפתחי Prometheus, מודל פתוח שאומן במיוחד להערכה לפי מחוון, הסבירו ב-2023 למה צריך חלופה: שופט מסחרי סגור הוא בעייתי לעבודה בהיקף גדול, כי אי אפשר לראות מה בתוכו, הגרסה שלו משתנה בלי שליטה של המשתמש והעלות גבוהה. במחקר שלהם, כשקיבל מחוון ותשובת דוגמה, Prometheus הגיע להתאמה לשופטים אנושיים ברמה של GPT-4.
השופט גם מאמן
השיטה לא משמשת רק למדידה. בשלב שבו מלמדים מודל להתנהג כמו עוזר טוב, בדרך כלל אנשים בוחרים בין שתי תשובות, וההעדפות שלהם משמשות לאימון (RLHF). איסוף העדפות כאלה יקר. ב-RLAIF, שיטה שהוצגה במחקר הבינה החוקתית של Anthropic מדצמבר 2022, מודל שפה מחליף את המתייגים האנושיים: הוא בוחר איזו משתי תשובות טובה יותר, ומההעדפות שלו מאמנים את המודל. מחקר מספטמבר 2023 מצא שבמשימות של סיכום ושל שיחה מועילה ובלתי מזיקה, האימון עם העדפות של מודל הגיע לביצועים דומים לאימון עם העדפות אנושיות. כלומר, אותו שופט שמודד את המודל יכול גם לעצב אותו, ולכן גם ההטיות שלו עלולות לעבור הלאה.
מה השיטה לא פותרת
סקירה מקיפה מנובמבר 2024 מנסחת את השאלה המרכזית של התחום כך: "איך בונים מערכות מודל-כשופט אמינות?" עצם השאלה מלמד שהתשובה עוד לא סגורה. שופט מלאכותי הוא קירוב זול שאפשר להריץ אלפי פעמים ביום, לא תחליף מוסמך לשיפוט אנושי, במיוחד בתחומים רגישים כמו רפואה או משפט. על השימוש בשופט להערכת סוכנים שמבצעים משימות שלמות אפשר לקרוא בערך הערכת סוכנים, ועל כלי מדידה כמו RAGAS בערך הייעודי.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| השוואה בזוגות | ציון ישיר | הערכה מול מקור | |
|---|---|---|---|
| מה השופט מקבל | שאלה ושתי תשובות | שאלה ותשובה אחת | תשובה ועוד חומר עזר: תשובת דוגמה או המסמכים שעליהם נשענה |
| מה הוא מחזיר | איזו תשובה טובה יותר | ציון או כן/לא לפי קריטריון | האם התשובה נכונה ונאמנה למקור |
| שימוש טיפוסי | דירוג מודלים זה מול זה | בדיקת נימוס, בהירות, טון | בדיקת דיוק במערכות שמחפשות במסמכים |
שאלות נפוצות ❓
האם אפשר לסמוך על ציון שנתן מודל שופט?
בזהירות. במחקר המכונן משנת 2023 שופט חזק הסכים עם בני אדם ביותר מ-80% מהמקרים, בערך כמו שבני אדם מסכימים זה עם זה. אבל לשופט יש הטיות ידועות, ולכן כדאי לבדוק אותו מול דוגמאות שבני אדם תייגו.
למה שופט מעדיף תשובות ארוכות?
זו אחת ההטיות המתועדות. תשובה מפורטת נראית יסודית יותר גם כשהיא לא טובה יותר. במבחן AlpacaEval פיתחו תיקון סטטיסטי שמנטרל את השפעת האורך.
האם מודל יכול לשפוט את עצמו?
טכנית כן, אבל מחקר מ-2024 הראה שמודלים מזהים טקסטים שהם כתבו ונוטים לתת להם ציון גבוה יותר. לכן עדיף ששופט ונשפט יהיו מודלים שונים.
מה ההבדל בין מודל שופט לבין מבחן (Benchmark)?
מבחן הוא אוסף שאלות קבוע עם דרך ניקוד. מודל שופט הוא שיטת ניקוד, ואפשר להשתמש בו גם בתוך מבחן, כמו ב-MT-Bench, כשאין תשובה נכונה אחת.