הרעיון המרכזי: כל משימה היא "טקסט-לטקסט"
T5 (ראשי-תיבות של Text-to-Text Transfer Transformer) הוא מודל של חוקרי גוגל, שהוצג במאמר "Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer" באוקטובר 2019, ופורסם בכתב-העת JMLR ב-2020. הרעיון המרכזי שלו: לנסח כל משימת עיבוד-שפה — תרגום, סיכום, סיווג, מענה-על-שאלות, ואפילו הערכת-דמיון בין שני משפטים — כאותה משימה בדיוק: קלט-טקסט מומר לפלט-טקסט. במקום ראשי-פלט ייעודיים למשימה שונים, T5 מקבל תווית-טקסט קצרה בתחילת הקלט (למשל "translate English to German:" או "summarize:") שמורה לו איזו משימה לבצע — כל זאת בתוך אותו מודל ואותו פורמט-קלט-ופלט בדיוק.
בניגוד ל-BERT ו-GPT: T5 שומר את שני חצאי הטרנספורמר
בעוד BERT משתמש רק בחצי הקודן (Encoder) של הטרנספורמר, ומשפחת GPT משתמשת רק בחצי המפענח (Decoder), T5 שומר על ארכיטקטורת-הקודן-מפענח המלאה כפי שהוצגה במאמר-הטרנספורמר המקורי מ-2017 — קודן שקורא את הטקסט הנכנס, ומפענח שמייצר את הטקסט היוצא מילה-אחר-מילה. הבחירה הזו הותאמה במיוחד למגוון-המשימות שהמודל נועד לבצע, כולל כאלה שבהן אורך-הקלט ואורך-הפלט שונים משמעותית זה מזה, כמו סיכום או תרגום.
מאגר C4: ניקוי מאסיבי של האינטרנט הפתוח
כדי לאמן את T5 בנו החוקרים מאגר-טקסט חדש בשם "קורפוס ניקוי-המונים" (Colossal Clean Crawled Corpus, C4) — גרסה מסוננת ומנוקה של סריקת-האינטרנט הכללית Common Crawl, גדולה פי-כ-100 מוויקיפדיה כולה. הניקוי כלל הסרת קטעי-קוד, טקסט חוזר, תוכן-פוגעני ושפות שאינן אנגלית, במטרה להשאיר טקסט טבעי ואיכותי-יחסית לאימון. C4 עצמו הפך מאז למאגר-אימון פופולרי ששימש מודלים רבים נוספים, מעבר ל-T5 בלבד.
חמישה גדלים, ותוצאות-שיא כמעט-אנושיות
החוקרים בדקו שיטתית עשרות שילובים של יעדי-אימון, ארכיטקטורות ומאגרי-נתונים, ובנו על סמך זה חמישה גדלי-מודל: Small (60 מיליון פרמטרים), Base (220 מיליון), Large (770 מיליון), 3B ו-11B (11 מיליארד). הגרסה הגדולה-ביותר השיגה תוצאות-שיא במבחני GLUE, SuperGLUE, SQuAD וסיכום-חדשות CNN/Daily Mail, כולל ציון שהתקרב לביצוע האנושי במבחן SuperGLUE — מבחן שתוכנן במפורש להיות קשה מספיק כדי לאתגר מערכות-למידת-מכונה.
השפעה מעבר לטקסט: T5 בתוך מודלים ליצירת תמונה
מעבר להשפעתו הישירה על תחום עיבוד-השפה, גרסה גדולה במיוחד של T5 (T5-XXL, כ-4.6 מיליארד פרמטרים) שימשה כרכיב "הבנת-טקסט" קפוא (בלי אימון-נוסף) בתוך Imagen — מודל יצירת-התמונות-מטקסט של גוגל מ-2022. המחקר שם הראה שהגדלת מודל-השפה שמקודד את הפרומפט חשובה לאיכות-התמונה הסופית אף יותר מהגדלת המודל שמייצר את התמונה עצמה — תובנה שהשפיעה על פיתוח מודלים נוספים בתחום.
ירושה: mT5, Flan-T5, וקוד פתוח מלא
גוגל פרסמה את קוד T5, המודלים המאומנים-מראש שלו ומחברת-Colab נלווית בקוד-פתוח מלא, מה שהפך אותו לבסיס נפוץ למחקר-המשך. גרסת mT5 הרחיבה את הגישה ל-101 שפות שונות; גרסת Flan-T5 (2022) עברה כוונון-הוראות (Instruction Tuning) על אלפי משימות שונות, ושיפרה משמעותית את ביצועיו על משימות חדשות שלא נראו באימון — עדות נוספת לגמישות שמאפשרת ארכיטקטורת-הקודן-מפענח המלאה.