Q² — מדד מהאוניברסיטה העברית, שואל שאלות על התשובה ומשווה

מודלים ושפה

הגדרה

Q² הוא מדד אוטומטי מתחום עיבוד-השפה-הטבעית להערכת נאמנות עובדתית של תשובות-צ'אטבוט מבוססות-ידע, הבודק האם התשובה סותרת את מקור-המידע שעליו היא מסתמכת, ומשמש לזיהוי הזיות.

מודלים שיחתיים מבוססי-ידע (Knowledge-Grounded Dialogue) מקבלים כקלט מסמך-מקור לצד השאלה, ואמורים לענות רק על סמך המידע שבו — אך בפועל נוטים לפעמים ל"הזות": לייצר תשובות שנשמעות משכנעות אך סותרות את המקור, או ממציאות פרטים שאינם מופיעים בו כלל. Q² הוא מדד אוטומטי שנועד לתת לתופעה הזאת ציון מספרי, בלי להזדקק לתשובת-ייחוס שנכתבה מראש בידי אדם ("מדד ללא-ייחוס") — יתרון מרכזי כשרוצים לבדוק שיחות חדשות בקנה-מידה גדול.

השיטה פועלת בשני שלבים. תחילה מפיק מודל שאלות-אוטומטי (Question Generation) שאלות מתוך הטענות שבתשובת-הצ'אטבוט; לאחר מכן מודל מענה-על-שאלות (Question Answering) מנסה לענות על אותן שאלות פעמיים — פעם מתוך התשובה עצמה ופעם מתוך מסמך-המקור. אם שתי התשובות תואמות, הטענה נחשבת נתמכת. הייחוד של Q² לעומת מדדים קודמים הוא שההשוואה בין שתי התשובות אינה מבוססת על חפיפת-מילים גרידא, אלא על מודל היסק-לשוני (Natural Language Inference) שבודק אם משמעות אחת סותרת, תומכת או ניטרלית ביחס לשנייה — כך שניסוח שונה של אותה עובדה לא נענש כשגיאה.

המדד פורסם ב-2021 בכנס EMNLP, במאמר של אור הונוביץ׳, לשם חושן, אלה נימן ועומרי אבנד מהאוניברסיטה העברית בירושלים, לצד רועי אהרוני ועידן שפקטור מ-Google Research — שיתוף-פעולה בין אקדמיה ישראלית לחברת בינה-מלאכותית גלובלית. לצד המדד עצמו פרסמו החוקרים גם מאגר-נתונים מתויג-ידנית, שנבנה על בסיס שיחות ממאגר Wizard-of-Wikipedia, כדי לוודא שהציונים של Q² אכן תואמים את שיפוט בני-האדם.

Q² הוא רק אחד מתוך משפחה רחבה של מדדים אוטומטיים להערכת נאמנות-עובדתית שפותחו סביב אותה תקופה — לצדם BLEU ו-ROUGE הוותיקים-יותר (המבוססים על חפיפת-מילים בלבד ולא בהכרח על עובדות), ומדדים ממוקדי-נאמנות כמו FactCC ו-SummaC. הבידול של Q² הוא ההתמקדות הספציפית בדיאלוג מבוסס-ידע ולא בסיכום-טקסט, והשילוב של שאלות-ותשובות עם היסק-לשוני. חסרונו העיקרי הוא עלות-חישוב: הרצתו דורשת הפעלה של שני מודלים נוספים — ליצירת שאלות ולמענה עליהן — מעבר למודל הנבדק עצמו.