טרנספורמר (Transformer)

מודלים ושפה

טרנספורמר (Transformer) הוא ארכיטקטורת רשת נוירונים שהוצגה ב-2017 במאמר המכונן "Attention Is All You Need", ומאז היא הבסיס לכמעט כל מודל שפה גדול בעולם — כולל GPT, Claude ו-Gemini. לפני הטרנספורמר, מודלים שעיבדו טקסט קראו אותו ברצף, מילה אחר מילה. לשיטה הזו היו שתי בעיות מרכזיות: ככל שהמשפט התארך, תחילתו כמעט נשכחה עד שהגיעו לסופו, וכיוון שכל מילה המתינה לקודמתה, לא היה אפשר לעבד אותן במקביל.

החידוש המרכזי של הטרנספורמר הוא מנגנון "תשומת לב" (attention): כל מילה בטקסט "מסתכלת" בבת אחת על כל שאר המילים במשפט, ומחשבת כמה כל אחת מהן רלוונטית להבנתה — בלי תלות בסדר הקריאה. לדוגמה, במשפט "החתול ברח מהכלב כי הוא פחד", מנגנון תשומת הלב הוא זה שקובע ש"הוא" מתייחס לחתול, לא לכלב — על ידי בחינה של כל המילים בבת אחת, לא קריאה מסודרת.

כיוון שאין תלות-סדר, אפשר לחשב את כל המילים במקביל במקום בזה-אחר-זה — מה שאיפשר לנצל חומרה מודרנית עד הסוף, ולאמן מודלים גדולים בהרבה, מהר בהרבה, ממה שהיה מעשי קודם. גל המודלים הגדולים שהגיע אחרי 2017 — כולל כל מה שנקרא GPT (שבו ה-T הוא ראשי תיבות של Transformer) — נשען כולו על הפריצה הזו.