Chinchilla — מודל-שפה בן 70 מיליארד, הביס את Gopher בן 280 מיליארד

מודלים ושפה

הגדרה

Chinchilla הוא מודל-שפה של Google DeepMind ממרץ 2022, שהוכיח בפועל שמודל קטן-יותר המאומן על יותר נתונים עולה על מודל ענק שאומן על פחות — ממצא שקבע את חוקי-קנה-המידה המקובלים היום.

Chinchilla הוא מודל-שפה שפרסמו חוקרי Google DeepMind ב-29 במרץ 2022, במאמר "Training Compute-Optimal Large Language Models". לצורך המחקר אימנו החוקרים למעלה מ-400 מודלים שונים, בגדלים שנעו בין 70 מיליון ל-16 מיליארד פרמטרים, על כמויות-נתונים שנעו בין 5 ל-500 מיליארד טוקנים — כדי לבדוק אמפירית מהו השילוב האופטימלי בין גודל-מודל לכמות-נתוני-האימון, בהינתן תקציב-חישוב קבוע.

המודל שנקרא בשם הכללי "Chinchilla" עצמו הוא תוצר-ההדגמה של המחקר: 70 מיליארד פרמטרים בלבד, שאומן על 1.4 טריליון טוקנים — פי-4 יותר נתונים מ-Gopher, מודל-קודם וגדול משמעותית של אותה מעבדה (280 מיליארד פרמטרים). במבחן MMLU (מבחן-ידע רחב) השיג Chinchilla 67.5%, שיפור של יותר מ-7 נקודות-אחוז על ציונו של Gopher — תוך שהוא זול משמעותית להרצה ולכוונון-עדין, בזכות גודלו הקטן יותר.

הממצא המרכזי, שנודע מאז כ"חוקי-קנה-המידה של Chinchilla", הוא שגודל-המודל וכמות-נתוני-האימון צריכים לגדול יחד באותו יחס: הכפלת מספר-הפרמטרים דורשת גם הכפלה של כמות-הטוקנים, לא רק הגדלת-המודל לבדו. החוקרים ניסחו זאת במפורש במאמר עצמו: מודלי-שפה גדולים באותה תקופה היו "תת-מאומנים באופן משמעותי" — תוצאה ישירה של מגמה שהתמקדה בהגדלת גודל-המודל בלבד, תוך השארת כמות-נתוני-האימון קבועה יחסית. בזמן פרסום המאמר, מודלי-דגל מובילים כמו GPT-3 (175 מיליארד פרמטרים) ו-Megatron-Turing NLG (530 מיליארד) הודרכו בעיקר לפי "הגדילו את המודל" — בדיוק הדפוס שהמחקר טען שהוא לא-יעיל.

ההשפעה של הממצא נמשכת עד היום. Chinchilla עצמו שימש בסיס למודל Flamingo, מודל-שפה-וראייה נוסף של DeepMind. והכלל "Chinchilla-optimal" הפך לנקודת-ייחוס סטנדרטית בתכנון-אימון של מודלי-שפה גדולים: מודלים מאוחרים יותר — כולל LLaMA של Meta ו-PaLM 2 של Google — מזכירים את Chinchilla במפורש בפרסומיהם, כשהם משווים את עצמם למודלי-הענק הקודמים שהיו גדולים ממנו פי-כמה אך פחות יעילים באימונם.