רשת נשנית (RNN)
הגדרה
רשת נשנית היא סוג רשת נוירונים שמתוכננת לעבד רצפים (כמו טקסט או קול) על ידי שמירת "זיכרון" של מה שעובד קודם — קודמת לטרנספורמר, שהחליף אותה ברוב מודלי השפה המודרניים.
רשת נשנית (RNN — Recurrent Neural Network) מתוכננת לעבד רצפים — כמו טקסט או קול — בכך שהיא שומרת "זיכרון" של מה שעיבדה קודם. בניגוד לרשת רגילה שמעבדת כל קלט בנפרד, RNN מזינה בחזרה לעצמה מידע מהצעד הקודם — כך היא "זוכרת" הקשר תוך כדי קריאת משפט, מילה אחר מילה.
הבעיה הגדולה ב-RNN הבסיסית היא שהיא שוכחת הקשר רחוק במהירות. הפתרון המרכזי הוא (LSTM — Long Short-Term Memory, זיכרון קצר-ארוך), שהוצג כבר ב-1997 על ידי החוקרים ספ הוכרייטר ויורגן שמידהובר, והוסיף לרשת מנגנון-שערים שמחליט מה לזכור ומה לשכוח — עיצוב שנשאר הסטנדרט למשך כמעט שני עשורים. גרסה פשוטה יותר, GRU (Gated Recurrent Unit), הוצגה ב-2014 והשיגה ביצועים דומים ל-LSTM עם פחות פרמטרים ומהירות-אימון גבוהה יותר — פשרה שהפכה אותה פופולרית ביישומים שבהם משאבי-חישוב היו מוגבלים.
דוגמה מוחשית ליישום ש-RNN שלטו בו: מערכות זיהוי-דיבור וכתוביות-אוטומטיות מוקדמות (למשל בגרסאות הראשונות של תרגום-Google ושל עוזרים קוליים) התבססו על LSTM לעיבוד רצף האודיו מילה-אחר-מילה. השימוש הזה כמעט נעלם עד היום: מערכות מודרניות כמו Whisper של OpenAI (2022) בנויות על ארכיטקטורת טרנספורמר, לא RNN.
RNN (ובגרסתם המשופרת, LSTM) שלטו בעיבוד שפה עד אמצע שנות ה-2010, אך התקשו "לזכור" הקשר ארוך במיוחד וסבלו מאימון איטי שקשה להריץ במקביל — כי כל צעד תלוי בתוצאת הצעד הקודם, כך שאי-אפשר לחשב את כל הרצף בו-זמנית על מעבד-גרפיקה. הטרנספורמר, שמעבד את כל הרצף בבת אחת במקום מילה-אחר-מילה, פתר את שתי הבעיות במחיר צריכת-זיכרון גבוהה יותר, והחליף אותן ברוב היישומים המודרניים.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות