T5 — מודל גוגל שהוליד את מאגר C4 ושימש גם בתוך Imagen

מודלים ושפה

הגדרה

T5 הוא מודל של גוגל מ-2019-2020 שמנסח כל משימת-שפה — תרגום, סיכום, סיווג ואפילו מענה-על-שאלות — כבעיית "טקסט-לטקסט" אחידה, ושומר על ארכיטקטורת-הקודן-מפענח המלאה של הטרנספורמר.

הרעיון המרכזי: כל משימה היא "טקסט-לטקסט"

T5 (ראשי-תיבות של Text-to-Text Transfer Transformer) הוא מודל של חוקרי גוגל, שהוצג במאמר "Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer" באוקטובר 2019, ופורסם בכתב-העת JMLR ב-2020. הרעיון המרכזי שלו: לנסח כל משימת עיבוד-שפה — תרגום, סיכום, סיווג, מענה-על-שאלות, ואפילו הערכת-דמיון בין שני משפטים — כאותה משימה בדיוק: קלט-טקסט מומר לפלט-טקסט. במקום ראשי-פלט ייעודיים למשימה שונים, T5 מקבל תווית-טקסט קצרה בתחילת הקלט (למשל "translate English to German:" או "summarize:") שמורה לו איזו משימה לבצע — כל זאת בתוך אותו מודל ואותו פורמט-קלט-ופלט בדיוק.

בניגוד ל-BERT ו-GPT: T5 שומר את שני חצאי הטרנספורמר

בעוד BERT משתמש רק בחצי הקודן (Encoder) של הטרנספורמר, ומשפחת GPT משתמשת רק בחצי המפענח (Decoder), T5 שומר על ארכיטקטורת-הקודן-מפענח המלאה כפי שהוצגה במאמר-הטרנספורמר המקורי מ-2017 — קודן שקורא את הטקסט הנכנס, ומפענח שמייצר את הטקסט היוצא מילה-אחר-מילה. הבחירה הזו הותאמה במיוחד למגוון-המשימות שהמודל נועד לבצע, כולל כאלה שבהן אורך-הקלט ואורך-הפלט שונים משמעותית זה מזה, כמו סיכום או תרגום.

מאגר C4: ניקוי מאסיבי של האינטרנט הפתוח

כדי לאמן את T5 בנו החוקרים מאגר-טקסט חדש בשם "קורפוס ניקוי-המונים" (Colossal Clean Crawled Corpus, C4) — גרסה מסוננת ומנוקה של סריקת-האינטרנט הכללית Common Crawl, גדולה פי-כ-100 מוויקיפדיה כולה. הניקוי כלל הסרת קטעי-קוד, טקסט חוזר, תוכן-פוגעני ושפות שאינן אנגלית, במטרה להשאיר טקסט טבעי ואיכותי-יחסית לאימון. C4 עצמו הפך מאז למאגר-אימון פופולרי ששימש מודלים רבים נוספים, מעבר ל-T5 בלבד.

חמישה גדלים, ותוצאות-שיא כמעט-אנושיות

החוקרים בדקו שיטתית עשרות שילובים של יעדי-אימון, ארכיטקטורות ומאגרי-נתונים, ובנו על סמך זה חמישה גדלי-מודל: Small (60 מיליון פרמטרים), Base (220 מיליון), Large (770 מיליון), 3B ו-11B (11 מיליארד). הגרסה הגדולה-ביותר השיגה תוצאות-שיא במבחני GLUE, SuperGLUE, SQuAD וסיכום-חדשות CNN/Daily Mail, כולל ציון שהתקרב לביצוע האנושי במבחן SuperGLUE — מבחן שתוכנן במפורש להיות קשה מספיק כדי לאתגר מערכות-למידת-מכונה.

השפעה מעבר לטקסט: T5 בתוך מודלים ליצירת תמונה

מעבר להשפעתו הישירה על תחום עיבוד-השפה, גרסה גדולה במיוחד של T5 (T5-XXL, כ-4.6 מיליארד פרמטרים) שימשה כרכיב "הבנת-טקסט" קפוא (בלי אימון-נוסף) בתוך Imagen — מודל יצירת-התמונות-מטקסט של גוגל מ-2022. המחקר שם הראה שהגדלת מודל-השפה שמקודד את הפרומפט חשובה לאיכות-התמונה הסופית אף יותר מהגדלת המודל שמייצר את התמונה עצמה — תובנה שהשפיעה על פיתוח מודלים נוספים בתחום.

ירושה: mT5, Flan-T5, וקוד פתוח מלא

גוגל פרסמה את קוד T5, המודלים המאומנים-מראש שלו ומחברת-Colab נלווית בקוד-פתוח מלא, מה שהפך אותו לבסיס נפוץ למחקר-המשך. גרסת mT5 הרחיבה את הגישה ל-101 שפות שונות; גרסת Flan-T5 (2022) עברה כוונון-הוראות (Instruction Tuning) על אלפי משימות שונות, ושיפרה משמעותית את ביצועיו על משימות חדשות שלא נראו באימון — עדות נוספת לגמישות שמאפשרת ארכיטקטורת-הקודן-מפענח המלאה.

שאלות נפוצות ❓

מה זה גישת 'טקסט-לטקסט' של T5?

הרעיון שכל משימת-שפה — תרגום, סיכום, סיווג ועוד — מנוסחת באותה צורה בדיוק: טקסט נכנס, עם תווית קצרה שאומרת איזו משימה לבצע, וטקסט יוצא. כך אפשר להשתמש באותו מודל ואותו פורמט לכל המשימות.

מה ההבדל בין T5 ל-BERT ו-GPT?

BERT משתמש רק בחצי הקודן של הטרנספורמר (הבנה), GPT רק בחצי המפענח (יצירה), ואילו T5 שומר על שני החצאים יחד — ארכיטקטורת-קודן-מפענח מלאה, שמתאימה במיוחד למשימות שבהן אורך-הקלט והפלט שונים.

מה זה C4, המאגר ששימש לאימון T5?

"קורפוס ניקוי-המונים" (Colossal Clean Crawled Corpus) — גרסה מסוננת ונקייה של סריקת-האינטרנט הכללית Common Crawl, שהפכה בעצמה למאגר-אימון פופולרי גם עבור מודלים אחרים.

האם T5 שימש רק לטקסט?

בעיקר כן, אך גרסה גדולה שלו שימשה גם כרכיב-הבנת-טקסט בתוך Imagen, מודל יצירת-התמונות-מטקסט של גוגל — עדות לכך שיכולות-הבנת-שפה שלו שימושיות גם מחוץ למשימות-טקסט טהורות.