מודל אוטורגרסיבי (Autoregressive Model)
הגדרה
מודל אוטורגרסיבי מייצר פלט טוקן אחר טוקן, כשכל טוקן חדש נחזה על סמך כל הטוקנים שכבר נוצרו — כך פועלים רוב מודלי השפה הגדולים ביצירת טקסט.
במקום להפיק תשובה שלמה בבת אחת, מודל אוטורגרסיבי בוחר מילה (או חלקיק-מילה) אחת בכל פעם, מוסיף אותה להקשר, ומשתמש בהקשר המעודכן כדי לחזות את הבאה בתור — וחוזר חלילה.
זו הסיבה שתשובות מ-ChatGPT או Claude "נכתבות" בהדרגה על המסך במקום להופיע בבת אחת — כל מילה חדשה תלויה בכל מה שנכתב לפניה, כולל מה שהמודל עצמו כבר "אמר" באותה תשובה.
הגישה האוטורגרסיבית קיימת במידול-שפה עוד מתחילת שנות ה-2000, הרבה לפני מודלי-הענק של היום — אך רק כשהיא שולבה עם ארכיטקטורת הטרנספורמר, מ-2017 ואילך, היא הפכה מעשית בקנה-מידה עצום. הגישה החלופית העיקרית — יצירה לא-אוטורגרסיבית, שמנסה לחזות כמה מילים או את כל המשפט בבת אחת — נחקרת גם היא, בעיקר כדי להאיץ את ההסקה, אך עדיין לא הדיחה את הגישה האוטורגרסיבית ממקומה כברירת-המחדל למודלי-שפה מובילים.
נקודה שמפתיעה רבים: אימון מודל אוטורגרסיבי דווקא כן מתבצע במקביל — המודל "רואה" בבת אחת דוגמאות שלמות מטקסט-אימון קיים, ולומד לחזות כל מילה מתוך המילים שקדמו לה. רק שלב היצירה בפועל (הסקה) חייב להיות רציף, טוקן-אחר-טוקן, כי טוקן מספר 50 תלוי בטוקן מספר 49 שהמודל עצמו זה עתה ייצר, לא בטקסט קיים מראש. אי-הסימטריה הזו בין אימון-מקבילי ליצירה-טורית היא הסיבה המרכזית לכך שיצירת תשובה ארוכה איטית משמעותית מיצירת תשובה קצרה — ולא רק "כבדה" יותר לחשב, אלא איטית מבחינה מבנית.
תכונה נלווית: מכיוון שהיצירה כבר בנויה כתהליך הדרגתי, ממשקי-שיחה רבים מנצלים זאת כדי לאפשר למשתמש "לעצור" תשובה באמצע, או לקרוא את תחילתה תוך כדי שהמשך הטקסט עדיין נוצר ברקע — יתרון-לוואי של המבנה האוטורגרסיבי, לא רק מגבלה שלו.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות