מה זו משימת מענה-על-שאלות
מענה-על-שאלות היא המשימה לבנות מערכת שמקבלת שאלה בשפה-טבעית ומחזירה תשובה ישירה וממוקדת — לא רשימת-קישורים או מסמכים רלוונטיים, כפי שעושה מנוע-חיפוש רגיל, אלא את התשובה עצמה. המשימה נחלקת בדרך-כלל לשני סוגים: מערכות תחום-סגור, שעונות רק על שאלות בתחום-ידע מוגדר וצר (כמו נתוני-מלאי של חברה אחת), ומערכות תחום-פתוח, שאמורות לענות על כל שאלה מבוססת-עובדות בכל נושא — האתגר הרבה יותר קשה, ומה שמאפיין את מודלי-השפה הגדולים של היום.
1971: LUNAR, המערכת-החלוצה של וודס
אחת ממערכות-המענה-על-שאלות המוקדמות ביותר הייתה LUNAR, שפיתח הבלשן-המחשוב ויליאם וודס במעבדות BBN עבור נאס"א. המערכת אפשרה לגיאולוגים לשאול, בשפה-טבעית, שאלות על ההרכב הכימי של דגימות-סלע וקרקע שמשימות-אפולו הביאו מהירח — בלי צורך ללמוד שפת-שאילתה פורמלית למסד-הנתונים. LUNAR הודגמה בכנס-מדעי-ירח ב-1971, וענתה נכון על 78% מהשאלות שהציבו לה משתמשים שלא הוכשרו על המערכת מראש (עוד 12% נכשלו רק בשל תקלות-קידוד טכניות במילון) — הישג יוצא-דופן לתקופה, על-בסיס פענוח-תחביר מבוסס-רשת-מעברים (Augmented Transition Network).
עשורים של מערכות תחום-סגור
LUNAR לא הייתה יחידה בדורה: BASEBALL, אחת ממערכות-המענה-על-שאלות המוקדמות ביותר בכלל, ענתה על שאלות לגבי משחקי-הליגה הגדולה בבייסבול; SHRDLU, שפיתח טרי וינוגרד בסוף שנות ה-60 ותחילת שנות ה-70, דימתה רובוט שמבין ומבצע פקודות בעולם-קוביות מדומה וקטן. המשותף לכל המערכות האלה — כללים לשוניים כתובים-ביד, תחום-ידע צר ומוגדר-מראש, ואפס יכולת להכליל לנושא שלא תוכנן במפורש עבורו. הדפוס הזה שלט בתחום עשרות שנים, עד שהגישות הסטטיסטיות ומאוחר יותר הנוירוניות איפשרו מעבר הדרגתי לתחום-פתוח.
14–16 בפברואר 2011: ווטסון מנצח בג'פרדי!
הרגע שהביא מענה-על-שאלות לתודעה הציבורית הרחבה היה ניצחון Watson של IBM בתוכנית-החידונים Jeopardy!. במשחק-תערוכה ששודר בשלושה פרקים, ב-14, 15 ו-16 בפברואר 2011, התמודד Watson מול שני האלופים המוכרים ביותר בתולדות התוכנית, קן ג'נינגס וברד רוטר — ובפרק המסכם, שנחתם ב-16 בפברואר, ניצח בפער גדול וזכה בפרס הראשון, מיליון דולר, ש-IBM תרמה במלואו לצדקה. ווטסון שילב אחזור-מידע ממאגר-ידע עצום עם ניתוח-שפה וציון-ביטחון סטטיסטי לכל תשובה מועמדת — הדגמה פומבית ראשונה בקנה-מידה גדול של מענה-על-שאלות בתחום-פתוח אמיתי, לא תחום-סגור. ארכיטקטורת DeepQA שביסוד ווטסון, שתועדה במאמר של דיוויד פרוצ'י ושותפיו ב-2010, יצרה במקביל מאות השערות-תשובה אפשריות לכל שאלה, אספה ראיות-תומכות עבור כל השערה בנפרד, ורק אז דירגה אותן זו מול זו לפי מידת-הביטחון — לא חיפוש ליניארי אחר "התשובה הנכונה", אלא תחרות מדורגת בין מועמדות.
2016: SQuAD והבנת-קריאה כבנצ'מרק
ב-2016 פרסמו חוקרים מסטנפורד, בהובלת פראנב רג'פורקר, את SQuAD (Stanford Question Answering Dataset) — מאגר של יותר מ-100,000 שאלות שחיברו עובדי-קהל על יותר מ-500 ערכי-ויקיפדיה, כשהתשובה לכל שאלה היא קטע-טקסט מדויק מתוך הפסקה עצמה. SQuAD הפך לבנצ'מרק המרכזי להבנת-קריאה ממוחשבת (Reading Comprehension) — משימה ממוקדת יותר ממענה-על-שאלות תחום-פתוח כללי, שבה המערכת מקבלת גם את הפסקה שמכילה את התשובה, לא רק את השאלה — ודחף פיתוח מהיר של מודלים נוירוניים ייעודיים להבנת-קריאה. ב-2018 פורסמה גרסה מורחבת, SQuAD 2.0, שהוסיפה יותר מ-50,000 שאלות נוספות שאין להן בכלל תשובה בתוך הפסקה הנתונה — שינוי שכפה על המערכות ללמוד גם מתי נכון להשיב "אין מספיק מידע", לא רק לאתר את קטע-הטקסט הנכון כשתשובה אכן קיימת.
היום: מודל-שפה כללי כמערכת-מענה
מודלי-שפה גדולים כלליים כמו GPT-4, ג'מיני וקלוד הם כיום, בפועל, שימוש-הקצה הנפוץ ביותר של מענה-על-שאלות — משתמשים שואלים אותם שאלות עובדתיות ומקבלים תשובה ישירה בפרומפט בודד, בלי כל מערכת-QA ייעודית. חלק מהמערכות משלבות גם אחזור-מידע חיצוני בזמן-אמת (RAG), כדי לבסס תשובות במקורות מעודכנים במקום להסתמך רק על מה שהמודל "זוכר" מאימונו. האתגר המרכזי שנשאר פתוח הוא הזיות — תשובה בטוחה-לכאורה אך שגויה עובדתית — שהופכת את מהימנות-התשובה, לא רק את שטף-הניסוח, לשאלת-המפתח בתחום.