כוונון-הוראות (Instruction Tuning)
הגדרה
כוונון-הוראות הוא שלב אימון נוסף שמלמד מודל-שפה לעקוב אחר הוראות ולענות בפורמט שיחה מועיל — ההבדל בין מודל שרק "משלים טקסט" למודל שמרגיש כמו עוזר.
מודל-יסוד גולמי (אחרי אימון ראשוני על טקסט מהאינטרנט) יודע להשלים טקסט בצורה סבירה סטטיסטית, אך לא בהכרח "מבין" שהוא צריך לענות לשאלה, לא רק להמשיך אותה.
כוונון-הוראות מאמן את המודל על זוגות רבים של "הוראה ← תשובה טובה", כך שהוא לומד את הפורמט של שיחת-עזרה שימושית — שלב הכרחי בדרך ממודל-יסוד גולמי לצ'אטבוט שמרגיש כמו ChatGPT או Claude. הגישה תוארה בפירוט במאמר InstructGPT של OpenAI מ-2022, שהניח את התשתית הישירה להשקת ChatGPT כמה חודשים אחר-כך.
דוגמה קונקרטית לזוג-אימון כזה: הוראה "תן לי שלושה רעיונות למתנת יום-הולדת לילד בן 10", מול תשובה שאכן עונה ישירות ובקצרה על הבקשה — לא ממשיכה אותה במשפט כמו "...וגם רעיונות למסיבת יום-הולדת", כפי שעלול לקרות במודל-יסוד גולמי שרק "משלים טקסט" בלי להבין שמדובר בבקשה. אלפי, ולעיתים מיליוני, זוגות כאלה — שנכתבים בידי בני-אדם או בידי מודל חזק אחר — הם חומר-הגלם לשלב הזה.
כוונון-הוראות לבדו אינו מספיק כדי להבטיח תשובות בטוחות או מנומסות באופן עקבי — לרוב הוא רק השלב הראשון מתוך כמה, ואחריו מגיעים שלבים נוספים כמו למידת-חיזוק מהעדפות אנושיות (RLHF — Reinforcement Learning from Human Feedback), שמעדנים עוד יותר את הטון והבטיחות של התשובות.
מוסכמת-שם נפוצה בעולם המודלים בעלי-המשקלים-הפתוחים: מודל שעבר כוונון-הוראות מסומן לרוב בסיומת "Instruct" או "Chat" בשמו (למשל "Llama-3-Instruct"), בעוד הגרסה בלי הסיומת היא מודל-היסוד הגולמי — מיועד בעיקר לחוקרים ולמפתחים שרוצים לבנות עליו כוונון משלהם, לא לשיחה ישירה עם משתמש-קצה. הבחנה זו חשובה למפתחים שבוחרים ממודל להוריד: מודל-בסיס בלי כוונון-הוראות עשוי לענות בצורה מוזרה או לא-רלוונטית לשאלה ישירה, גם אם ה"ידע" הגולמי שלו זהה למודל המכוונן.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות