הבעיה: שכחה מהירה מדי
רשת נשנית (RNN) בסיסית מעבדת רצף — כמו משפט — צעד-אחר-צעד, ומעבירה מהצעד הקודם לצעד הבא מצב-חבוי אחד שאמור לשמש כ"זיכרון". בפועל, כשמאמנים רשת כזו באמצעות התפשטות-לאחור על פני רצף ארוך, הגרדיאנט שמלמד את הרשת מה לזכור נוטה להתכווץ עד שהוא נעלם כמעט לחלוטין — תופעה שמוכרת כ"בעיית הגרדיאנט הנעלם" (vanishing gradient). התוצאה המעשית: רשת נשנית בסיסית שוכחת הקשר שהופיע כמה עשרות צעדים קודם לכן, גם אם הוא היה חיוני להבנת ההמשך. ספ הוכרייטר ניתח את הבעיה הזו לראשונה בעבודת-הדיפלומה שלו ב-1991, עוד לפני שהוצע לה פתרון מעשי ורחב-שימוש.
הפתרון: תא-זיכרון נפרד
הוכרייטר ויורגן שמידהובר הציגו את הפתרון בשם "זיכרון קצר-ארוך" (Long Short-Term Memory — LSTM), שפורסם במלואו בכתב-העת Neural Computation ב-1997 (כרך 9, גיליון 8, עמודים 1735–1780) — הגרסה שנחשבת כיום למקור המצוטט העיקרי, אחרי גרסאות מוקדמות יותר כדוח-טכני וכהצגה בכנס NIPS 1996. הרעיון המרכזי: להוסיף לרשת, לצד המצב-החבוי הרגיל, "תא-זיכרון" (cell state) נפרד — מעין מסוע פנימי שמידע יכול לזרום דרכו כמעט ללא שינוי לאורך זמן רב, בניגוד למצב-החבוי הרגיל שמתעדכן בכל צעד ומתערבב בקלות. תא-הזיכרון הזה הוא מה שמאפשר לרשת לגשר על מרווחי-זמן ארוכים בהרבה מרשת נשנית בסיסית.
מנגנון-השערים
הגישה אל תא-הזיכרון מבוקרת על ידי "שערים" — רכיבים פנימיים קטנים, כל אחד מהם פלט-סיגמואיד בין 0 ל-1, שמכפילים את המידע העובר דרכם ובכך קובעים כמה ממנו לתת לעבור. שער-קלט (input gate) קובע כמה מהמידע החדש בצעד הנוכחי ייכנס לתא-הזיכרון. שער-פלט (output gate) קובע כמה מתוכן תא-הזיכרון ישפיע על הפלט הגלוי של הצעד הנוכחי. שני השערים האלה הופיעו כבר בעיצוב המקורי מ-1997. הרעיון המרכזי מאחורי שני השערים ותא-הזיכרון יחד מכונה לעיתים "קרוסלת-שגיאה קבועה" (constant error carousel) — מנגנון שמאפשר לגרדיאנט לזרום כמעט ללא היחלשות דרך תא-הזיכרון, ובכך פותר את בעיית הגרדיאנט הנעלם שמנעה מרשת נשנית בסיסית לזכור הקשר רחוק.
שער-השכחה: התוספת שהפכה לסטנדרט
בעיצוב המקורי מ-1997 לא היה לרשת דרך לרוקן את תא-הזיכרון ביזמתה — מידע יכול היה רק להצטבר בו. הפתרון לכך הגיע כמה שנים מאוחר יותר: פליקס גרס, יורגן שמידהובר ופרד קאמינס הציגו "שער-שכחה" (forget gate) נוסף, במאמר "Learning to Forget: Continual Prediction with LSTM" שפורסם ב-Neural Computation ב-2000 (כרך 12, גיליון 10). שער-השכחה קובע כמה מתוכן תא-הזיכרון הקיים "למחוק" בכל צעד, ומאפשר לרשת לאפס את עצמה במקומות המתאימים — למשל בתחילת משפט חדש. התוספת הזו אומצה כמעט באופן אוניברסלי, עד כדי כך שכשמדברים היום על "LSTM" מתכוונים כמעט תמיד לגרסה עם שלושת השערים יחד — קלט, שכחה ופלט — לא לעיצוב המקורי בן שני השערים.
השפעה בתעשייה: מזיהוי-דיבור לתרגום
LSTM לא נשאר הישג אקדמי בלבד — הוא הניע כמה מהמוצרים הרחבים ביותר בתעשיית-הבינה-המלאכותית בשנות ה-2010. ב-2015 עברה Google להשתמש ברשת LSTM המאומנת בשיטת CTC בזיהוי-הדיבור של Google Voice, ולפי הודעת החברה, הצעד הזה צמצם את שיעור שגיאות-התמלול בכמחצית. ב-2016 עברה Google Translate למערכת חדשה מבוססת-LSTM בשם GNMT (Google Neural Machine Translation); לפי מאמר-המחקר שפרסמו מפתחי המערכת, בהערכה אנושית על שלושה זוגות-שפות — אנגלית-צרפתית, אנגלית-ספרדית ואנגלית-סינית — שיעור שגיאות-התרגום ירד ב-60% לעומת המערכת הקודמת מבוססת-הביטויים. פייסבוק דיווחה שבאוגוסט 2017 היא עברה במלואה לתרגום-מכונה מבוסס-רשתות-נוירונים מסוג LSTM, וביצעה בכך יותר מ-4.5 מיליארד תרגומים אוטומטיים ביום. שלוש הדוגמאות האלה ממחישות עד כמה LSTM היה, לפני עידן הטרנספורמר, הארכיטקטורה המעשית המובילה לכל משימה שדורשת עיבוד רצף שפה או קול.
המגבלה שנשארה: אימון סדרתי
למרות הפתרון לבעיית הגרדיאנט הנעלם, ל-LSTM נשארה מגבלה מובנית שהיא חלק בלתי-נפרד מהיותה רשת נשנית: היא מעבדת רצף צעד-אחר-צעד, וכל צעד תלוי בתוצאת הצעד הקודם. המשמעות המעשית היא שאי-אפשר לחשב את כל שלבי הרצף בבת-אחת במקביל על מעבד-גרפיקה, מה שהופך אימון על רצפים ארוכים ומאגרי-נתונים גדולים לאיטי יחסית. הטרנספורמר, שהוצג ב-2017, מעבד את כל הרצף בבת-אחת באמצעות מנגנון-קשב במקום צעד-אחר-צעד, ופתר את הבעיה הזו במחיר צריכת-זיכרון גבוהה יותר — מה שהוביל להחלפה כמעט מלאה של LSTM ברוב יישומי עיבוד-השפה המובילים במהלך השנים שאחרי.
GRU: הפישוט שבא אחריה
ב-2014 הציעו קיונגהיון צ'ו ושותפיו, ובהם יושוע בנג'יו, ארכיטקטורה מפושטת בשם GRU (Gated Recurrent Unit): במקום שלושה שערים ותא-זיכרון נפרד מהפלט הגלוי כמו ב-LSTM, ל-GRU יש רק שני שערים בלי הפרדה כזו. הפישוט הזה מקטין את מספר הפרמטרים הנדרש ללמידה ומאיץ את האימון, לרוב בלי לפגוע משמעותית בביצועים. GRU לא ביטל את LSTM — שתי הארכיטקטורות עדיין קיימות זו לצד זו במקומות שבהם עדיין נבחרת רשת נשנית על פני טרנספורמר — אבל היחס בין השתיים ברור: LSTM היא הפתרון הקודם, המורכב והמבוסס יותר; GRU היא הגרסה הפשוטה יותר שבאה אחריה, ונבנתה במפורש כדי לשמר את רוב היכולת של LSTM עם פחות מנגנונים פנימיים.