GPT-2 — מודל-שפה שאומן על 8 מיליון דפים מקישורים ב-Reddit

מודלים ושפה

הגדרה

GPT-2 הוא מודל יצירת-טקסט של OpenAI מ-2019, ששוחרר בהדרגה במשך תשעה חודשים מחשש לשימוש-לרעה — הפולמוס הציבורי הראשון על מדיניות-שחרור אחראית של מודלי-שפה גדולים.

מה זה GPT-2, ולמה הוא נבנה

GPT-2 (ראשי-תיבות של Generative Pre-trained Transformer 2) הוא מודל-שפה של OpenAI, שהוצג בפברואר 2019 במאמר "Language Models are Unsupervised Multitask Learners" מאת אלק רדפורד ועמיתיו. בניגוד ל-BERT המקביל של גוגל, GPT-2 בנוי על חצי ה"מפענח" (Decoder) בלבד של ארכיטקטורת הטרנספורמר, ומיועד לייצר טקסט — לא רק להבין טקסט קיים. הרעיון המרכזי: מודל שמתאמן על משימה פשוטה יחסית — לנחש את המילה הבאה ברצף טקסט, שוב ושוב, על כמות עצומה של טקסט מהאינטרנט — יכול ללמוד תוך-כדי-כך מגוון רחב של משימות-שפה, בלי שאף אחת מהן תוכננה עבורו במפורש.

ארבע גרסאות בגדלים שונים, ואימון על WebText

OpenAI אימנה ארבע גרסאות של GPT-2. לפי טבלה 2 במאמר המקורי, גדליהן הם 117 מיליון, 345 מיליון, 762 מיליון ו-1.5 מיליארד פרמטרים (הגדולה — פי-כ-12 מגרסת-הקודמת שלו, GPT-1). המספרים של שלוש הגרסאות הקטנות התבררו כשגויים בשל שגיאת-ספירה — OpenAI עצמה תיקנה אותם מאוחר יותר, ב-README הרשמי של מאגר-הקוד שלה, ל-124 מיליון / 355 מיליון / 774 מיליון פרמטרים בהתאמה, המספרים המקובלים היום ברוב הכלים וההטמעות (כמו כרטיס-המודל של Hugging Face). האימון התבסס על מאגר-טקסט בשם WebText: כ-8 מיליון דפי-אינטרנט, שנאספו מקישורים-יוצאים שפורסמו באתר Reddit וזכו לפחות ל-3 "קארמה" (אישורי-איכות של משתמשים) — שיטת-סינון פשוטה שנועדה להעדיף טקסט איכותי-יחסית על פני רעש אקראי.

השחרור המדורג: תשעה חודשים בין הגרסה הקטנה לגדולה

בפברואר 2019 שחררה OpenAI רק את הגרסה הקטנה ביותר (117 מיליון פרמטרים לפי המאמר המקורי — מספר שהתברר מאוחר יותר כשגוי בשל שגיאת-ספירה; לאחר שהחברה תיקנה אותו היא מוכרת היום כ-"124M"), והודיעה שהיא נמנעת בכוונה משחרור הגרסאות הגדולות יותר — צעד חריג שהצדיקה בחשש שהמודל יכול לשמש ליצירה המונית של חדשות מזויפות, תגובות-רשת מזויפות או ספאם משכנע. בהמשך שוחררו גרסת-הביניים (345 מיליון, מאי 2019) והגרסה הגדולה-יותר (762 מיליון, אוגוסט 2019), עד ששוחררה הגרסה המלאה (1.5 מיליארד פרמטרים) בנובמבר 2019 — לאחר כתשעה חודשים שבהם OpenAI חקרה בעצמה, ופרסמה מאמר-מלווה ייעודי, על ההשפעה החברתית האפשרית של שחרור מודל כזה.

הפולמוס: מדיניות-שחרור אחראית, לראשונה

השחרור המדורג הזה הצית את הוויכוח הציבורי הראשון והרחב-ביותר על "מדיניות-שחרור אחראית" (Responsible Disclosure) בתחום מודלי-השפה — האם ראוי בכלל שחברה תמנע מהציבור גישה למחקר-AI שהיא עצמה פרסמה, ומתי. מבקרים טענו שההחלטה הייתה מיותרת, ותומכים ראו בה תקדים אחראי וזהיר. הוויכוח הזה — שממשיך למעשה עד היום, סביב כל מודל חדש ועוצמתי — נעשה תחום-מחקר בפני עצמו, ותועד במאמר-arXiv נפרד שפרסמה OpenAI ב-2019 בשם "Release Strategies and the Social Impacts of Language Models".

יכולות ללא-אימון-ייעודי (Zero-shot), ולמה זה הפתיע

מה שהדהים חוקרים בזמנו היה שהמודל — שאומן אך ורק לנחש מילים הבאות — הצליח לבצע בהצלחה סבירה משימות שמעולם לא אומן עליהן במפורש, כמו סיכום טקסטים, תרגום בסיסי, ומענה-על-שאלות, רק מתוך ניסוח ההוראה בשפה טבעית בתוך הפרומפט עצמו. יכולת זו, שנקראת "אימון-אפס" (Zero-shot Learning), הראתה לראשונה שהגדלת מודל ונתוני-האימון, בלי שינוי אלגוריתמי, יכולה לייצר יכולות חדשות שלא תוכננו מראש — תובנה שהניעה ישירות את הפיתוח של GPT-3 שנה אחר-כך.

שאלות נפוצות ❓

למה OpenAI לא שחררה את כל הגרסאות של GPT-2 בבת אחת?

מחשש שהגרסה הגדולה (1.5 מיליארד פרמטרים) תשמש ליצירה המונית של חדשות מזויפות או ספאם משכנע — ולכן שחררה אותה בהדרגה, במשך כתשעה חודשים, תוך מחקר-נלווה על ההשפעה החברתית האפשרית.

מה ההבדל בין GPT-2 ל-BERT?

GPT-2 בנוי על חצי המפענח (Decoder) של הטרנספורמר ומיועד ליצירת טקסט, ואילו BERT בנוי על חצי הקודן (Encoder) ומיועד להבנת טקסט קיים — שני ענפים שונים מאותה ארכיטקטורת-בסיס.

האם GPT-2 עדיין בשימוש היום?

כמעט לא באפליקציות מסחריות — הוחלף מאז בגרסאות חדשות ומשופרות בהרבה (GPT-3, GPT-4 ואילך) — אך הוא נשאר נקודת-ציון היסטורית חשובה ומשמש עדיין למחקר ולהוראה.

מה זה "אימון-אפס" (Zero-shot) שהודגם ב-GPT-2?

היכולת לבצע משימה חדשה בהצלחה בלי לקבל דוגמאות-אימון ייעודיות עבורה מראש, רק מתוך ניסוח ההוראה בשפה טבעית — יכולת שהפתיעה חוקרים והראתה שהגדלת מודל, לבדה, יכולה לייצר יכולות חדשות.