Mamba — ארכיטקטורת-רשת ללא קשב; משולבת ב-Jamba, הסקה מהירה פי-5

מודלים ושפה

הגדרה

Mamba היא ארכיטקטורת רשת-נוירונים מ-2023, מבוססת state-space models, שמוותרת לגמרי על מנגנון-הקשב של הטרנספורמר — ומציעה תחתיו זמן-ריצה שגדל באופן ליניארי, לא ריבועי, עם אורך-הטקסט.

Mamba היא ארכיטקטורת רשת-נוירונים שפרסמו ב-1 בדצמבר 2023 החוקרים אלברט גו (Albert Gu, קרנגי-מלון) וטרי דאו (Tri Dao, פרינסטון), במאמר "Mamba: Linear-Time Sequence Modeling with Selective State Spaces". בניגוד לגישות "קשב-יעיל" אחרות שנועדו רק לקצר את זמן-החישוב של מנגנון-הקשב, Mamba מוותרת עליו כליל: המאמר עצמו מתאר אותה כארכיטקטורה "בלי קשב, ואפילו בלי שכבות MLP" — לא שיפור על הטרנספורמר, אלא חלופה מבנית שלמה, מבוססת על מה שנקרא "מודלי-מרחב-מצבים" (State Space Models).

מודל-מרחב-מצבים קורא טקסט ברצף, מילה-אחרי-מילה, ושומר "מצב פנימי" מתעדכן — במובן הזה הוא קרוב-מושגית ל-RNN (רשת-נוירונים-חוזרת), לא לטרנספורמר, שקורא את כל המשפט בבת-אחת. אבל ל-RNN קלאסי היה קושי לשמר מידע לטווח-ארוך, ואי-אפשר היה לאמן אותו על חלקים שונים של הטקסט במקביל. החידוש המרכזי של Mamba — "סלקטיביות" — הוא לתת לפרמטרים של המצב-הפנימי עצמם להיקבע לפי הטוקן הנוכחי, כך שהמודל "בוחר" דינמית מה לזכור ומה לשכוח תוך כדי קריאה, ובכל זאת משתמש באלגוריתם-חישוב מותאם-לחומרה שמאפשר אימון מקבילי, כמו בטרנספורמר.

לפי המאמר, Mamba מציגה תפוקת-הסקה (Inference) מהירה פי-5 מטרנספורמר, זמן-חישוב שגדל באופן ליניארי (לא ריבועי) עם אורך-הרצף, ויכולת עיבוד שנבדקה בהצלחה על רצפים באורך מיליון-טוקן. מודל Mamba-3B עלה על מודלי-טרנספורמר בגודל דומה, והשתווה למודלי-טרנספורמר גדולים ממנו פי-2, גם באימון-הבסיס וגם במבחני-הערכה. בפועל, האימוץ התעשייתי נטה לכיוון שילוב, לא החלפה מלאה: החברה הישראלית AI21 Labs שילבה שכבות-Mamba לצד שכבות-טרנספורמר במודל Jamba שלה (מרץ 2024), כדי להגיע לחלון-הקשר של עד 256,000 טוקן ביעילות-זיכרון גבוהה יותר ממודל-טרנספורמר-טהור בגודל דומה. שילוב דומה אימצה גם טנסנט הסינית במודל-ההיסק Hunyuan T1 שלה (מרץ 2025).

חשוב שלא לבלבל את Mamba עם ארכיטקטורת "תערובת-מומחים" (Mixture-of-Experts): שתיהן דרכים נפרדות להתמודד עם עלות-החישוב של מודלי-שפה גדולים, אבל בציר שונה לגמרי. תערובת-מומחים משנה כמה מהפרמטרים של המודל מופעלים בכל שאילתה, בלי לגעת באופן שבו הוא קורא את הרצף עצמו — ואילו Mamba משנה את מנגנון-קריאת-הרצף עצמו, בלי קשר לשאלה כמה פרמטרים פעילים בו-זמנית. השתיים אינן מתחרות זו בזו, ולכן אפשר גם לשלב ביניהן באותו מודל.