InstructGPT — מודל בן 1.3 מיליארד שהועדף על פני GPT-3 בן ה-175

מודלים ושפה

הגדרה

InstructGPT הוא מודל של OpenAI מ-2022 שכוונן באמצעות למידת-חיזוק מהערכה אנושית (RLHF) לציית להוראות טוב יותר מ-GPT-3 — השיטה שהפכה חודשים אחר-כך לבסיס-האימון הישיר של ChatGPT.

מה זה InstructGPT, ומתי הוא הושק

InstructGPT היא משפחת-מודלים ש-OpenAI הכריזה עליה ב-27 בינואר 2022, בפוסט-בלוג בשם "Aligning language models to follow instructions", כאשר המאמר-האקדמי המלא — "Training language models to follow instructions with human feedback", מאת לונג אואיאנג ו-19 שותפים-למחקר — הועלה ל-arXiv רק כחודש וחצי אחר-כך, ב-4 במרץ 2022. InstructGPT יצא מנקודת-ההתחלה של GPT-3 וכוונן-עדין כדי לציית לכוונה האמיתית שמאחורי הוראת-המשתמש — לא רק להמשיך את הטקסט סטטיסטית — יעד-אימון שונה מהיעד המקורי של GPT-3.

שלושת השלבים של RLHF, כפי שיושמו ב-InstructGPT

השיטה, למידת-חיזוק מהערכה אנושית (Reinforcement Learning from Human Feedback, RLHF), התבצעה בשלושה שלבים. ראשית, כוונון-מפוקח (Supervised Fine-Tuning): המודל אומן על דוגמאות-תשובה שכתבו בני-אדם עבור מגוון הוראות. שנית, אימון מודל-תגמול (Reward Model): מתייגים אנושיים דירגו כמה תשובות-מודל שונות לאותה הוראה מהטובה לפחות-טובה, והדירוגים האלה שימשו לאימון מודל נפרד שלמד לחזות איזו תשובה בני-אדם יעדיפו. שלישית, שיפור המודל המקורי מול מודל-התגמול הזה, בעזרת אלגוריתם למידת-חיזוק (PPO) — תהליך שמתגמל את המודל על תשובות שמודל-התגמול מדרג גבוה, בלי צורך בדוגמת-תשובה אנושית לכל הוראה חדשה.

התוצאה שהפתיעה: מודל קטן פי-100 שהעדיפו על פני GPT-3 המלא

הממצא המרכזי של המאמר: מעריכים אנושיים, שהשוו תשובות בעיוורון, העדיפו את התשובות של המודל הקטן ביותר במשפחת InstructGPT — רק 1.3 מיליארד פרמטרים — על פני תשובות ה-GPT-3 המלא, בעל 175 מיליארד פרמטרים, למרות פער של פי-100 בגודל. זה הראה שעבור משימות יומיומיות רבות, איכות-האימון (יישור עם כוונת המשתמש) יכולה להיות משמעותית יותר מגודל-המודל הגולמי — ממצא שהפתיע תחום שעד אז מדד התקדמות בעיקר במונחי היקף גולמי.

מ-InstructGPT ל-ChatGPT: "מודל-אח", לא אותו מודל

כעשרה חודשים אחר-כך, ב-30 בנובמבר 2022, השיקה OpenAI את ChatGPT. בפוסט-ההשקה הרשמי היא הגדירה את היחס במפורש: "ChatGPT הוא מודל-אח (Sibling Model) ל-InstructGPT, שמאומן לציית להוראה בפרומפט ולספק תשובה מפורטת". זו הבחנה מדויקת וחשובה: ChatGPT אינו InstructGPT עם ממשק-שיחה שהודבק עליו — אלה מודל נפרד, שכוונן מתוך מודל ממשפחת GPT-3.5 באותה שיטת-RLHF כמו InstructGPT, אך על נתוני-אימון שנאספו במיוחד עבור שיחה רב-תורית ולא רק עבור תשובה בודדת להוראה. טכניקת ה-RLHF עצמה היא הרקמה-המקשרת בין שלושת הדברים — InstructGPT, המאמר שמתעד את השיטה בפירוט, ו-ChatGPT — אך מדובר בשלושה דברים נפרדים: מודל ספציפי, מאמר-מחקר שמתעד שיטת-אימון, ומוצר-אח מאוחר ונפרד שנבנה באותה שיטה על נתונים אחרים.

מה עוד השתפר: פחות המצאות, פחות תוכן רעיל

מעבר לציות טוב יותר להוראות, OpenAI דיווחה שמודלי InstructGPT הפיקו פחות עובדות-מומצאות ופחות תוכן רעיל בהשוואה ל-GPT-3 על מבחני-ההערכה שנעשה בהם שימוש, וההכללה עבדה באופן סביר גם עבור הוראות בשפות ותחומים שלא היו מיוצגים בנתוני-הכוונון. המאמר גם כן בגילוי-לב לגבי מגבלות: InstructGPT עדיין טעה בעובדות פשוטות, לעיתים ציית להוראות מזיקות אם נוסחו בזהירות מספקת, ויישור-הכוונות שלו שיקף בעיקר את ההעדפות וההנחיות הספציפיות של המתייגים בשכר של OpenAI עצמה, לא תקן אוניברסלי כלשהו של "מועילות".

למה ההשקה הזאת נחשבת בדיעבד לנקודת-מפנה

טביעת-הרגל של InstructGPT בעולם האמיתי הייתה בהתחלה שקטה יחסית — הוא הפך לברירת-המחדל החדשה מאחורי ה-API של OpenAI כבר בינואר 2022, שינוי טכני שרוב הצרכנים כלל לא הבחינו בו. המשמעות ההיסטורית שלו התבררה רק בדיעבד, אחרי שההשקה הפומבית של ChatGPT הדגימה לקהל המוני עד כמה תהליך-האימון מבוסס-RLHF, שהוצג לראשונה על InstructGPT, יכול לשנות עד כמה טבעי ושימושי מודל-שפה מרגיש בשיחה בפועל — והפך טכניקת-מחקר שחודדה על InstructGPT לבסיס שכמעט כל מודל-שיחה גדול שיצא מאז אימץ בצורה כזו או אחרת.

שאלות נפוצות ❓

האם InstructGPT הוא אותו מודל כמו ChatGPT?

לא — OpenAI עצמה מגדירה את ChatGPT כ"מודל-אח" (Sibling Model) ל-InstructGPT: שניהם אומנו בשיטת RLHF דומה, אך ChatGPT הוא מודל נפרד שכוונן על נתוני-שיחה ולא רק על הוראות בודדות.

מה זה RLHF, ואיך InstructGPT השתמש בו?

למידת-חיזוק מהערכה אנושית — תהליך תלת-שלבי: כוונון-מפוקח על דוגמאות שכתבו אנשים, אימון מודל-תגמול על דירוגי-העדפה אנושיים, ואז שיפור המודל מול מודל-התגמול הזה בעזרת למידת-חיזוק.

למה זה מפתיע שמודל בן 1.3 מיליארד פרמטרים "ניצח" מודל בן 175 מיליארד?

כי זה הראה שאיכות-האימון (יישור עם כוונת המשתמש) יכולה להיות משמעותית יותר מגודל-המודל הגולמי — ממצא שסתר את ההנחה הרווחת אז ש"גדול יותר תמיד שווה טוב יותר".

מתי בדיוק הושק InstructGPT, ומתי פורסם המאמר עליו?

הבלוג הרשמי פורסם ב-27 בינואר 2022; המאמר האקדמי המלא, עם כל פרטי-השיטה, פורסם רק כחודש וחצי אחר-כך, ב-4 במרץ 2022.