מענה על שאלות (Question Answering)

מודלים ושפה

הגדרה

מענה על שאלות הוא תחום ב-NLP שמטרתו לבנות מערכות שעונות בשפה-טבעית ישירות על שאלת-משתמש, ולא רק מחזירות רשימת-מסמכים רלוונטיים כמו מנוע-חיפוש רגיל.

מה זו משימת מענה-על-שאלות

מענה-על-שאלות היא המשימה לבנות מערכת שמקבלת שאלה בשפה-טבעית ומחזירה תשובה ישירה וממוקדת — לא רשימת-קישורים או מסמכים רלוונטיים, כפי שעושה מנוע-חיפוש רגיל, אלא את התשובה עצמה. המשימה נחלקת בדרך-כלל לשני סוגים: מערכות תחום-סגור, שעונות רק על שאלות בתחום-ידע מוגדר וצר (כמו נתוני-מלאי של חברה אחת), ומערכות תחום-פתוח, שאמורות לענות על כל שאלה מבוססת-עובדות בכל נושא — האתגר הרבה יותר קשה, ומה שמאפיין את מודלי-השפה הגדולים של היום.

1971: LUNAR, המערכת-החלוצה של וודס

אחת ממערכות-המענה-על-שאלות המוקדמות ביותר הייתה LUNAR, שפיתח הבלשן-המחשוב ויליאם וודס במעבדות BBN עבור נאס"א. המערכת אפשרה לגיאולוגים לשאול, בשפה-טבעית, שאלות על ההרכב הכימי של דגימות-סלע וקרקע שמשימות-אפולו הביאו מהירח — בלי צורך ללמוד שפת-שאילתה פורמלית למסד-הנתונים. LUNAR הודגמה בכנס-מדעי-ירח ב-1971, וענתה נכון על 78% מהשאלות שהציבו לה משתמשים שלא הוכשרו על המערכת מראש (עוד 12% נכשלו רק בשל תקלות-קידוד טכניות במילון) — הישג יוצא-דופן לתקופה, על-בסיס פענוח-תחביר מבוסס-רשת-מעברים (Augmented Transition Network).

עשורים של מערכות תחום-סגור

LUNAR לא הייתה יחידה בדורה: BASEBALL, אחת ממערכות-המענה-על-שאלות המוקדמות ביותר בכלל, ענתה על שאלות לגבי משחקי-הליגה הגדולה בבייסבול; SHRDLU, שפיתח טרי וינוגרד בסוף שנות ה-60 ותחילת שנות ה-70, דימתה רובוט שמבין ומבצע פקודות בעולם-קוביות מדומה וקטן. המשותף לכל המערכות האלה — כללים לשוניים כתובים-ביד, תחום-ידע צר ומוגדר-מראש, ואפס יכולת להכליל לנושא שלא תוכנן במפורש עבורו. הדפוס הזה שלט בתחום עשרות שנים, עד שהגישות הסטטיסטיות ומאוחר יותר הנוירוניות איפשרו מעבר הדרגתי לתחום-פתוח.

14–16 בפברואר 2011: ווטסון מנצח בג'פרדי!

הרגע שהביא מענה-על-שאלות לתודעה הציבורית הרחבה היה ניצחון Watson של IBM בתוכנית-החידונים Jeopardy!. במשחק-תערוכה ששודר בשלושה פרקים, ב-14, 15 ו-16 בפברואר 2011, התמודד Watson מול שני האלופים המוכרים ביותר בתולדות התוכנית, קן ג'נינגס וברד רוטר — ובפרק המסכם, שנחתם ב-16 בפברואר, ניצח בפער גדול וזכה בפרס הראשון, מיליון דולר, ש-IBM תרמה במלואו לצדקה. ווטסון שילב אחזור-מידע ממאגר-ידע עצום עם ניתוח-שפה וציון-ביטחון סטטיסטי לכל תשובה מועמדת — הדגמה פומבית ראשונה בקנה-מידה גדול של מענה-על-שאלות בתחום-פתוח אמיתי, לא תחום-סגור. ארכיטקטורת DeepQA שביסוד ווטסון, שתועדה במאמר של דיוויד פרוצ'י ושותפיו ב-2010, יצרה במקביל מאות השערות-תשובה אפשריות לכל שאלה, אספה ראיות-תומכות עבור כל השערה בנפרד, ורק אז דירגה אותן זו מול זו לפי מידת-הביטחון — לא חיפוש ליניארי אחר "התשובה הנכונה", אלא תחרות מדורגת בין מועמדות.

2016: SQuAD והבנת-קריאה כבנצ'מרק

ב-2016 פרסמו חוקרים מסטנפורד, בהובלת פראנב רג'פורקר, את SQuAD (Stanford Question Answering Dataset) — מאגר של יותר מ-100,000 שאלות שחיברו עובדי-קהל על יותר מ-500 ערכי-ויקיפדיה, כשהתשובה לכל שאלה היא קטע-טקסט מדויק מתוך הפסקה עצמה. SQuAD הפך לבנצ'מרק המרכזי להבנת-קריאה ממוחשבת (Reading Comprehension) — משימה ממוקדת יותר ממענה-על-שאלות תחום-פתוח כללי, שבה המערכת מקבלת גם את הפסקה שמכילה את התשובה, לא רק את השאלה — ודחף פיתוח מהיר של מודלים נוירוניים ייעודיים להבנת-קריאה. ב-2018 פורסמה גרסה מורחבת, SQuAD 2.0, שהוסיפה יותר מ-50,000 שאלות נוספות שאין להן בכלל תשובה בתוך הפסקה הנתונה — שינוי שכפה על המערכות ללמוד גם מתי נכון להשיב "אין מספיק מידע", לא רק לאתר את קטע-הטקסט הנכון כשתשובה אכן קיימת.

היום: מודל-שפה כללי כמערכת-מענה

מודלי-שפה גדולים כלליים כמו GPT-4, ג'מיני וקלוד הם כיום, בפועל, שימוש-הקצה הנפוץ ביותר של מענה-על-שאלות — משתמשים שואלים אותם שאלות עובדתיות ומקבלים תשובה ישירה בפרומפט בודד, בלי כל מערכת-QA ייעודית. חלק מהמערכות משלבות גם אחזור-מידע חיצוני בזמן-אמת (RAG), כדי לבסס תשובות במקורות מעודכנים במקום להסתמך רק על מה שהמודל "זוכר" מאימונו. האתגר המרכזי שנשאר פתוח הוא הזיות — תשובה בטוחה-לכאורה אך שגויה עובדתית — שהופכת את מהימנות-התשובה, לא רק את שטף-הניסוח, לשאלת-המפתח בתחום.

שלושה דורות של מערכות מענה-על-שאלות
תחום-סגור (LUNAR, שנות ה-70)אחזור וניקוד (Watson, 2011)מודל-שפה כללי (מ-2020 ואילך)
טווח-הנושאיםתחום-ידע צר ומוגדר-מראש בלבדכל נושא — תחום-פתוח אמיתיכל נושא, כולל שאלות שלא נכתבו במיוחד לבדיקה
שיטת-התשובהכללים לשוניים כתובים-ביד ופענוח-תחביר קשיחמאות השערות-תשובה, איסוף-ראיות ודירוג-ביטחון סטטיסטיניחוש ישיר מתוך פרמטרי-המודל, לעיתים עם אחזור-מידע חי (RAG)
עלות הרחבה לנושא חדשגבוהה — דורשת בנייה מחדש של הכלליםגבוהה — דורשת מאגר-ידע ואימון ייעודינמוכה — אותו מודל עונה על כל נושא בלי שינוי

שאלות נפוצות ❓

מה ההבדל בין מענה-על-שאלות למנוע-חיפוש רגיל?

מנוע-חיפוש מחזיר רשימת-מסמכים רלוונטיים שהמשתמש צריך לעיין בהם; מערכת מענה-על-שאלות מחזירה את התשובה עצמה, ישירות.

מהי LUNAR, ומה היא עשתה?

מערכת שפיתח ויליאם וודס ב-BBN, שאפשרה לגיאולוגים לשאול בשפה-טבעית על הרכב דגימות-הסלע מהירח שהביאו משימות-אפולו; הודגמה ב-1971 וענתה נכון על 78% מהשאלות.

מתי ווטסון של IBM ניצח ב-Jeopardy!, ובכמה?

במשחק-תערוכה ששודר ב-14–16 בפברואר 2011 מול קן ג'נינגס וברד רוטר, וזכה בפרס הראשון של מיליון דולר.

מה זה SQuAD?

מאגר-נתונים מסטנפורד מ-2016, עם יותר מ-100,000 שאלות על ערכי-ויקיפדיה, שהפך לבנצ'מרק המרכזי להערכת מערכות הבנת-קריאה ממוחשבת.