דלג לתוכן

כוונון-הוראות (Instruction Tuning)

מודלים ושפה

הגדרה

כוונון-הוראות הוא שלב אימון נוסף שמלמד מודל-שפה לעקוב אחר הוראות ולענות בפורמט שיחה מועיל — ההבדל בין מודל שרק "משלים טקסט" למודל שמרגיש כמו עוזר.

מודל-יסוד גולמי (אחרי אימון ראשוני על טקסט מהאינטרנט) יודע להשלים טקסט בצורה סבירה סטטיסטית, אך לא בהכרח "מבין" שהוא צריך לענות לשאלה, לא רק להמשיך אותה.

כוונון-הוראות מאמן את המודל על זוגות רבים של "הוראה ← תשובה טובה", כך שהוא לומד את הפורמט של שיחת-עזרה שימושית — שלב הכרחי בדרך ממודל-יסוד גולמי לצ'אטבוט שמרגיש כמו ChatGPT או Claude. הגישה תוארה בפירוט במאמר InstructGPT של OpenAI מ-2022, שהניח את התשתית הישירה להשקת ChatGPT כמה חודשים אחר-כך.

דוגמה קונקרטית לזוג-אימון כזה: הוראה "תן לי שלושה רעיונות למתנת יום-הולדת לילד בן 10", מול תשובה שאכן עונה ישירות ובקצרה על הבקשה — לא ממשיכה אותה במשפט כמו "...וגם רעיונות למסיבת יום-הולדת", כפי שעלול לקרות במודל-יסוד גולמי שרק "משלים טקסט" בלי להבין שמדובר בבקשה. אלפי, ולעיתים מיליוני, זוגות כאלה — שנכתבים בידי בני-אדם או בידי מודל חזק אחר — הם חומר-הגלם לשלב הזה.

כוונון-הוראות לבדו אינו מספיק כדי להבטיח תשובות בטוחות או מנומסות באופן עקבי — לרוב הוא רק השלב הראשון מתוך כמה, ואחריו מגיעים שלבים נוספים כמו למידת-חיזוק מהעדפות אנושיות (RLHF — Reinforcement Learning from Human Feedback), שמעדנים עוד יותר את הטון והבטיחות של התשובות.

מוסכמת-שם נפוצה בעולם המודלים בעלי-המשקלים-הפתוחים: מודל שעבר כוונון-הוראות מסומן לרוב בסיומת "Instruct" או "Chat" בשמו (למשל "Llama-3-Instruct"), בעוד הגרסה בלי הסיומת היא מודל-היסוד הגולמי — מיועד בעיקר לחוקרים ולמפתחים שרוצים לבנות עליו כוונון משלהם, לא לשיחה ישירה עם משתמש-קצה. הבחנה זו חשובה למפתחים שבוחרים ממודל להוריד: מודל-בסיס בלי כוונון-הוראות עשוי לענות בצורה מוזרה או לא-רלוונטית לשאלה ישירה, גם אם ה"ידע" הגולמי שלו זהה למודל המכוונן.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו