דלג לתוכן

טרנספורמר (Transformer)

מודלים ושפה

הגדרה

טרנספורמר הוא ארכיטקטורת רשת נוירונים מ-2017 שמנגנון "תשומת הלב" שלה הוא הבסיס לכמעט כל מודל שפה גדול בעולם היום.

💡 דוגמה

במשפט "החתול ברח מהכלב כי הוא פחד", הטרנספורמר מבין ש"הוא" זה החתול, כי הוא מסתכל על כל המילים יחד.

המקור: הבעיה עם רשתות-נוירונים חוזרות שהטרנספורמר פתר

טרנספורמר (Transformer) הוא ארכיטקטורת רשת נוירונים שהוצגה ב-2017 במאמר המכונן "Attention Is All You Need" מאת חוקרי Google, ומאז היא הבסיס לכמעט כל מודל שפה גדול (LLM) בעולם — כולל משפחת GPT (ראשי-תיבות של Generative Pre-trained Transformer, "טרנספורמר מאומן-מראש ליצירה") של OpenAI, Claude של Anthropic, ו-Gemini של Google. לפני הטרנספורמר, מודלים שעיבדו טקסט קראו אותו ברצף, מילה אחר מילה, בשיטות שנקראו רשתות נוירונים חוזרות (Recurrent Neural Networks — RNN). לשיטה הזו היו שתי בעיות מרכזיות: ככל שהמשפט התארך, תחילתו כמעט "נשכחה" עד שהגיעו לסופו — בעיה שגרסאות משופרות כמו LSTM (זיכרון-לטווח-קצר-ארוך) הקלו עליה חלקית אך לא פתרו לגמרי — וכיוון שכל מילה המתינה לעיבוד קודמתה, לא היה אפשר לעבד את כולן במקביל.

החידוש: מנגנון תשומת-הלב וקידוד-מיקום

החידוש המרכזי של הטרנספורמר הוא מנגנון "תשומת לב" (Self-Attention): כל מילה בטקסט "מסתכלת" בבת-אחת על כל שאר המילים במשפט, ומחשבת כמה כל אחת מהן רלוונטית להבנתה — בלי תלות בסדר הקריאה או במרחק ביניהן. לדוגמה, במשפט "החתול ברח מהכלב כי הוא פחד", מנגנון תשומת הלב הוא זה שקובע ש"הוא" מתייחס לחתול, לא לכלב — על ידי בחינה של כל המילים בבת-אחת, לא קריאה מסודרת אחת-אחרי-השנייה. הארכיטקטורה המקורית כללה שישה שכבות זהות של מקודד (Encoder) ושישה של מפענח (Decoder), וכל שכבה משתמשת ב"תשומת-לב מרובת-ראשים" (Multi-Head Attention) — כמה "ראשי-קשב" נפרדים שכל אחד לומד לשים-לב להיבט שונה של הקשרי-המילים במקביל, ותוצאותיהם משולבות יחד בסוף.

בעיה טכנית שהמנגנון הזה חייב לפתור היא שוויתור על קריאה סדורה פירושו שהמודל מאבד לגמרי את מושג הסדר במשפט — בלי מנגנון נוסף, "החתול רדף אחרי הכלב" ו"הכלב רדף אחרי החתול" היו נראים למודל זהים. הפתרון, "קידוד מיקום" (Positional Encoding), מוסיף לכל מילה חתימה מספרית המבוססת על פונקציות סינוס וקוסינוס בתדרים שונים, שמסמנת את מיקומה המדויק ברצף — כך שהמודל יכול לשמור גם על סדר-המילים וגם על יכולת-העיבוד-המקבילי בבת-אחת. השילוב הזה — קשב בלי תלות-סדר, פלוס קידוד-מיקום שמחזיר את הסדר כמידע נפרד — הוא מה שאיפשר לנצל חומרה מודרנית (בעיקר מעבדי-גרפיקה, GPU) עד הסוף, ולאמן מודלים גדולים בהרבה, מהר בהרבה, ממה שהיה מעשי בשיטות הקודמות.

שלוש משפחות עיקריות ומעבר לטקסט: BERT, GPT, T5 ו-ViT

מהארכיטקטורה הבסיסית הזו צמחו שלוש משפחות עיקריות, שכל אחת ניצלה חלק שונה ממנה. BERT (חברת Google, 2018) משתמש רק בחלק המקודד, וקורא טקסט בשני הכיוונים בבת-אחת — מצוין למשימות הבנה כמו סיווג-טקסט וחיפוש, אבל לא בנוי ליצור טקסט חדש. GPT (OpenAI, ראשון פורסם ב-2018, GPT-3 ב-2020 עם 175 מיליארד פרמטרים) משתמש רק בחלק המפענח, וקורא טקסט בכיוון אחד בלבד תוך ניבוי-המילה-הבאה ברצף — מה שהופך אותו לטבעי ליצירת טקסט חדש, ולכן זו הארכיטקטורה שרוב הצ'אטבוטים המודרניים בנויים עליה. גישות מסוימות, כמו T5 של Google, משתמשות בשני החלקים יחד, בדומה למבנה המקורי של 2017.

הטרנספורמר גם חרג מזמן מגבולות עיבוד-הטקסט. Vision Transformer (ViT — טרנספורמר-ראייה), שהוצג ב-2020, מיישם את אותו רעיון בדיוק על תמונות: במקום לפרק משפט למילים, הוא מפרק תמונה ל"טלאים" (Patches) — ריבועים קטנים — ומתייחס לכל טלאי כאילו היה "מילה" שהמנגנון יכול לחשב עבורה קשב מול כל שאר הטלאים. הגישה הזו התחרתה בהצלחה ברשתות-הקונבולוציה (CNN) שהיו הסטנדרט הקודם לראיית-מחשב, והפכה מאז לבסיס גם למודלים שיוצרים תמונות ווידאו, לא רק כאלה שמזהים אותם.

המחיר: סיבוכיות ריבועית, קשב-דליל ותערובת-מומחים

היתרון של תשומת-הלב — כל מילה "רואה" כל מילה אחרת בבת-אחת — הוא גם המחיר שלה: כמות החישוב הדרושה גדלה ביחס ריבועי לאורך הטקסט (אם הטקסט מכפיל את אורכו, החישוב מרובע פי ארבעה), מה שהפך חלונות-הקשר (Context Window) ארוכים מאוד ליקרים במיוחד מבחינה חישובית. הבעיה הזו — הידועה כ"סיבוכיות ריבועית" — מניעה חלק ניכר ממחקר-הארכיטקטורה מאז 2020: גרסאות "קשב-דליל" (Sparse Attention) מגבילות כל מילה להסתכל רק על תת-קבוצה של המילים האחרות במקום כולן, וגישות חדשות יותר כמו "קשב-ליניארי" (Linear Attention), שאומצה במודלים מסחריים מסוימים נכון ל-2026, וגישה נפרדת-לחלוטין המוותרת על מנגנון-הקשב כליל — ארכיטקטורת Mamba, המבוססת על "מודלי-מרחב-מצבים" (State Space Models) — מנסות לשמר את רוב יכולת-הקשב תוך הפחתת הסיבוכיות מריבועית לליניארית, כלומר חישוב שגדל בקצב איטי הרבה יותר עם אורך הטקסט.

ארכיטקטורת "תערובת-מומחים" (Mixture-of-Experts — MoE), שאומצה בהרחבה ממודלים מובילים מאז 2023-2024, פותרת בעיה קשורה אך שונה: איך להגדיל את מספר הפרמטרים הכולל של המודל (וכך את קיבולת-הידע שלו) בלי להגדיל בהתאם את עלות-החישוב לכל שאילתה בודדת. הרעיון: לפצל את שכבות-הרשת ל"מומחים" מקבילים רבים, ולתת למודל ללמוד לבחור, לכל טוקן בודד, רק בכמה מומחים מתוך כולם להפעיל בפועל — כך שהמודל "יודע" הרבה יותר בסך-הכול ממה שהוא בפועל "מחשב" בכל רגע נתון. גישה זו מובחנת מהשיפורים במנגנון-הקשב עצמו, אבל שתיהן חלק מאותה מגמה כללית: לשמר את עוצמת הטרנספורמר המקורי תוך התמודדות עם עלות-החישוב שהוא גורר.

השפעת המאמר המקורי, ומגבלות הארכיטקטורה

ההשפעה של המאמר המקורי על התחום קשה להפריז בה. "Attention Is All You Need" נכתב במקור כפתרון לבעיה צרה יחסית — שיפור תרגום-מכונה — ולא כניסיון להמציא ארכיטקטורת-יסוד לכל תחום ה-AI, אבל צוטט מאז למעלה מ-250,000 פעמים, מה שהופך אותו לאחד מעשרת המאמרים המצוטטים ביותר של המאה ה-21 בכל תחום מדעי, לא רק במדעי-המחשב. עדות נוספת, בלתי-רגילה, לגודל ההשפעה: כל אחד משמונת המחברים המקוריים עזב בשלב כלשהו את גוגל, ברובם כדי להקים או להצטרף לחברת AI מתחרה — בהם Cohere, Character.AI, ו-Essential AI — תופעה שתועדה בהרחבה כ"נדידת-המוחות" שהמאמר הזה, באופן עקיף, יצר.

חשוב גם להכיר את המגבלות הבסיסיות של הארכיטקטורה, מעבר לסיבוכיות-החישוב. טרנספורמר סטנדרטי מאומן על אורך-רצף מקסימלי קבוע מראש, וביצועיו נוטים להידרדר כשמנסים להאריך אותו משמעותית מעבר לאורך שראה באימון — אחת הסיבות שהרחבת חלון-ההקשר של מודל קיים היא פרויקט-הנדסי בפני עצמו, ולא רק שינוי-הגדרה. כמו כן, זיכרון-העבודה הדרוש לחישוב הקשב גדל גם הוא ביחס לאורך-הרצף, לא רק זמן-החישוב — מה שהופך הרצה של הקשרים ארוכים מאוד לתובענית מבחינת חומרה, לא רק איטית.

כמעט עשור, ועדיין הסטנדרט

חשוב לזכור שהטרנספורמר עצמו לא "מבין" שפה בשום מובן שמקביל להבנה אנושית — הוא מנגנון מתמטי ללמידת-דפוסים סטטיסטיים בין יחידות-טקסט. העובדה שהוא מסוגל להפיק תוצאות שנראות "חכמות" נובעת מהיקף האימון העצום שהוא עובר, לא מארכיטקטורה שמכילה "הבנה" מובנית מראש. עם זאת, כמעט תשע שנים אחרי פרסום המאמר המקורי, אף ארכיטקטורה חלופית לא הצליחה להחליף אותו כברירת-המחדל התעשייתית באופן גורף — נכון ל-2026, כמעט כל מודל שפה מסחרי מוביל עדיין מבוסס על אותה ארכיטקטורת-קשב בסיסית מ-2017, אף שנוספו עליה שכלולים הנדסיים רבים, החל מ-MoE וכלה בשיטות-קשב-יעילות-יותר. העובדה שארכיטקטורה יחידה נשארה דומיננטית כל-כך הרבה זמן, בתחום שמתאפיין בקצב-שינוי מהיר במיוחד, היא עצמה נקודה ראויה-לציון: רוב ה"פריצות" הגדולות של השנים האחרונות — עלייה חדה בגודל, מודלי-חשיבה, יכולות רב-אמצעיות — הושגו על-גבי אותו שלד בסיסי, לא על-ידי החלפתו בארכיטקטורה שונה-מהיסוד.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שלושה שימושים בארכיטקטורת הטרנספורמר: מקודד, מפענח, או שניהם
BERT (מקודד בלבד)GPT (מפענח בלבד)T5 (מקודד ומפענח)
כיוון קריאהדו-כיווניכיוון אחד (משמאל לימין)משתנה לפי המשימה
משימה טבעיתהבנה וסיווג-טקסטיצירת טקסט חדשהמרת-טקסט (תרגום, סיכום)
דוגמה מוכרתמנועי-חיפושChatGPT, Claude, GeminiGoogle Translate (חלקית)

שאלות נפוצות ❓

האם טרנספורמר זה אותו דבר כמו LLM?

לא בדיוק — טרנספורמר הוא הארכיטקטורה (השלד ההנדסי), ומודל שפה גדול (LLM) הוא המוצר הסופי שנבנה עליה אחרי אימון על כמויות ענק של טקסט.

למה קוראים למנגנון "תשומת לב"?

כי הוא מחשב, לכל מילה, כמה "תשומת-לב" לתת לכל מילה אחרת במשפט כדי להבין את ההקשר שלה — בדומה לאופן שבו אדם קורא ושם לב לחלק מהמילים יותר מאחרות.

האם טרנספורמר משמש רק לטקסט?

לא — גרסאות כמו Vision Transformer מיישמות את אותו רעיון על תמונות, ומודלים רב-אמצעיים משתמשים בו גם לאודיו ולווידאו.

מה מגביל את הטרנספורמר?

בעיקר עלות-חישוב שגדלה ביחס ריבועי לאורך הטקסט, מה שמייקר משמעותית עיבוד של הקשרים ארוכים מאוד — זו הסיבה המרכזית לחיפוש אחר ארכיטקטורות-קשב יעילות יותר.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו