מה זה סיכום-אוטומטי
סיכום אוטומטי היא המשימה לקצר טקסט אחד או יותר לגרסה קצרה משמעותית, שעדיין משמרת את המידע המרכזי שבמקור — באופן חישובי, בלי עורך אנושי שקורא ומנסח. המשימה יכולה לפעול על מסמך בודד (מאמר, כתבה, אימייל) או על אוסף-מסמכים שלם, כשהמטרה בסוג-האחרון היא לחלץ את מה שמשותף או משמעותי מבין כמה מקורות בבת-אחת — למשל, סיכום כל כתבות-החדשות שפורסמו על אירוע מסוים ביום נתון, לא רק אחת מהן.
1958: לוהן והבסיס הסטטיסטי של התחום
הפרסום המתועד הראשון בתחום היה מאמרו של האנס פיטר לוהן, חוקר ב-IBM, "The Automatic Creation of Literature Abstracts", שהופיע ב-IBM Journal of Research and Development, כרך 2, ב-1958. לוהן הזין טקסט מלא של מאמר טכני, במחשב IBM 704, וחישב עבור כל מילה ולאחר-מכן עבור כל משפט ציון-חשיבות סטטיסטי, המבוסס על תדירות-המילה והתפלגותה במסמך. המשפטים שקיבלו את הציונים הגבוהים ביותר הודפסו כפי שהם, ללא כל שינוי-ניסוח, כ"תקציר-אוטומטי" — השיטה הסטטיסטית-חילוצית הראשונה מסוגה, שקבעה את כיוון-המחקר לעשרות שנים.
שתי גישות: חילוצית מול גנרטיבית
התחום מתחלק לשתי אסטרטגיות שונות מהותית. סיכום חילוצי (Extractive) בוחר ומעתיק משפטים שלמים מתוך הטקסט המקורי, בלי לשנות אותם — בדיוק השיטה שלוהן הציע כבר ב-1958 — מה שמבטיח דיוק עובדתי אך עלול להפיק תוצר מקוטע שלא זורם כמו טקסט רציף. סיכום גנרטי (Abstractive) מנסח מחדש את התוכן במילים חדשות שלא הופיעו במקור, בדומה למה שעורך אנושי היה עושה — דורש מהמערכת לבנות ייצוג-משמעות פנימי של הטקסט, לא רק לדרג משפטים, והוא מורכב טכנית בהרבה.
עידן הלמידה העמוקה: מרשתות-רצף לטרנספורמר
לאורך שנות ה-2010 עבר סיכום-גנרטי ממודלי רשת-נוירונים חוזרת (RNN/LSTM) מקצה-לקצה למודלים מבוססי-טרנספורמר, שממפים רצף-טקסט אחד לרצף-טקסט אחר — התאמה טבעית למשימת-סיכום. מודלים כמו T5 ו-Pegasus, ששניהם יצאו כטיוטה מוקדמת ב-2019 ופורסמו בכנסים ובכתבי-עת ב-2020 — T5 מבית Google, ו-Pegasus בשיתוף Google ואימפריאל קולג' לונדון — אומנו במיוחד על משימות מיפוי-טקסט-לטקסט מהסוג הזה. שיטת-האימון-המקדים של Pegasus מחדדת את הרעיון עד תום: מוחקים משפטים-חשובים ממסמך-אימון, והמודל נדרש לשחזר אותם כרצף-פלט אחד מתוך שאר המסמך — למעשה, אימון-מקדים שמדמה את משימת-הסיכום עצמה עוד לפני שהמודל ראה ולו דוגמת-סיכום מתויגת אחת. הגישה הזו אפשרה לראשונה סיכום גנרטי בקנה-מידה גדול ברמת-שטף גבוהה משמעותית מגרסאות-הרשתות-החוזרות הקודמות — מה שהאיץ את המעבר ההדרגתי של התחום, שהחל חילוצי בעיקרו, לכיוון גנרטי.
יישומים היום
סיכום אוטומטי משולב כיום ישירות בכלי-עבודה יומיומיים: מצרפי-חדשות מסכמים כתבות ארוכות לפסקת-פתיחה; כלים משפטיים ורפואיים מסכמים מסמכי-תיק עבים לגרסה קריאה; ותמלולי-פגישות וישיבות-עבודה מקבלים סיכום אוטומטי של הנקודות המרכזיות. עוזרי-AI מובנים כמו Microsoft 365 Copilot ו-Google Workspace מציעים היום סיכום-אוטומטי מיידי של מסמכים, שרשורי-אימייל ופגישות, על-בסיס מודלי-שפה גדולים גנרטיים — לא עוד תוסף נפרד, אלא תכונה מובנית שרוב המשתמשים כלל לא שמים-לב שהיא פועלת ברקע.
האתגר המתמשך: נאמנות עובדתית בסיכום גנרטי
הסיכון המרכזי בסיכום גנרטי הוא הזיה — ניסוח משפט שנשמע טבעי אך טוען עובדה שלא מופיעה כלל במקור, סיכון שכמעט לא קיים בסיכום חילוצי, שרק מעתיק. מדד-ההערכה הקלאסי של התחום, ROUGE (Recall-Oriented Understudy for Gisting Evaluation), שפיתח צ'ין-יו לין ופרסם ב-2004, סופר חפיפת n-gram בין הסיכום שהמערכת הפיקה לבין סיכומי-ייחוס שכתבו בני-אדם — ושימש להערכה במסגרת סדרת-כנסי DUC (Document Understanding Conference), שהריצה NIST משנת 2001 ועד 2007 ולאחריה הפכה למסלול קבוע בתוך TAC (Text Analysis Conference) מ-2008 — אך חפיפת-מילים כזו לא בהכרח תופסת בעיית-נאמנות: סיכום יכול לחפוף היטב במילים ועדיין לטעון משהו שגוי. לכן מחקר "נאמנות עובדתית" (Factual Consistency) הפך בשנים האחרונות לכיוון-מחקר עצמאי בתוך התחום, נפרד מהערכת-חפיפה-טקסטואלית גרידא.