דלג לתוכן

קשב-עצמי (Self-Attention)

מודלים ושפה

הגדרה

קשב-עצמי הוא סוג של מנגנון-קשב שבו רצף (כמו משפט) "מסתכל על עצמו" — כל מילה בוחנת את יחסה לכל מילה אחרת באותו רצף, כדי לבנות ייצוג עשיר-הקשר.

בקשב-עצמי, המקור והיעד של הקשב הם אותו רצף בדיוק — המודל בוחן איך כל מילה במשפט קשורה לכל שאר המילים באותו משפט, כדי להבין תפקיד ומשמעות מדויקים יותר. הרעיון הוצג לראשונה ב-2016, שנה לפני הטרנספורמר, כדרך לשפר הבנת-קריאה ברשתות נשניות — אבל רק כשהוא הפך לאבן-הבניין היחידה של ארכיטקטורה שלמה, במקום תוספת לרשת נשנית קיימת, הוא הראה את מלוא הפוטנציאל שלו.

לדוגמה, במשפט "הכלב רדף אחרי הילד כי הוא היה רעב", קשב-עצמי הוא זה שמאפשר למודל לקשר את "הוא" בחזרה ל"הכלב" ולא ל"הילד" — לא באמצעות כלל דקדוקי מפורש שמישהו תכנת, אלא מתוך למידה סטטיסטית של תבניות דומות שראה באימון.

זו הטכניקה הליבתית בתוך שכבת הטרנספורמר: היא מאפשרת למילה כמו "היא" להתחבר אוטומטית לשם שהיא מתייחסת אליו, גם אם הוא הופיע כמה משפטים קודם — וההבדל המכריע בינה לבין קשב "רגיל" הוא בדיוק העובדה שהמקור והיעד זהים.

מגבלה ידועה של קשב-עצמי היא עלות-החישוב: מכיוון שכל מילה "משווה" את עצמה לכל מילה אחרת ברצף, כמות החישוב גדלה בערך ביחס לריבוע אורך הטקסט — טקסט כפול-אורך דורש פי ארבעה חישוב, לא פי שניים. זו הסיבה המרכזית לכך שהגדלת חלון-הקשר (ראו אורך הקשר) של מודלי-שפה היא אתגר הנדסי משמעותי, לא רק עניין של "יותר זיכרון" — ומניעה חלק ניכר ממחקר-האופטימיזציה שמאחורי מודלי-השפה של השנים האחרונות. לשם המחשה: הכפלת אורך-הטקסט מ-1,000 ל-2,000 מילה לא מכפילה את זמן-החישוב פי שניים אלא פי ארבעה בקירוב — וזה מה שהופך טקסטים ארוכים-במיוחד ליקרים באופן לא-פרופורציונלי לעבד, לא רק לאיטיים. חלק ניכר ממחקר-הארכיטקטורות של השנים האחרונות (שיטות-קשב-דלילות, מנגנוני-שיפור-יעילות שונים) עוסק בדיוק בניסיון לרכך את העלות הריבועית הזו בלי לוותר על היתרון המרכזי של קשב-עצמי — היכולת "לראות" כל מילה מכל מילה אחרת.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו