דלג לתוכן

כוונון עדין (Fine-tuning)

מודלים ושפה

הגדרה

כוונון עדין (Fine-tuning) הוא אימון נוסף וממוקד של מודל קיים על נתונים ספציפיים, כדי להתאים אותו למשימה או תחום.

💡 דוגמה

לוקחים מודל כללי ומאמנים אותו עוד קצת על אלפי מסמכים משפטיים, והוא מתחיל לכתוב כמו עורך דין. המחיר: הוא עלול להיחלש בשיחה רגילה.

מה זה כוונון עדין, והפריצה שהנגישה אותו: LoRA ו-QLoRA

כוונון עדין (Fine-tuning) הוא אימון נוסף וממוקד של מודל AI קיים על נתונים ספציפיים, כדי להתאים אותו למשימה או לתחום מסוימים — במקום לבנות מודל חדש מאפס. הרעיון מבוסס על עיקרון פשוט מלמידת-מכונה: מודל שכבר אומן על כמויות-ענק של נתונים כלליים (תהליך שנקרא אימון-מוקדם, Pre-training) כבר "למד" הרבה מבני-שפה, עובדות ודפוסי-חשיבה כלליים; כוונון עדין רק מכוונן חלק קטן יחסית מהמשקלים הפנימיים של המודל כדי להטות אותו לכיוון ספציפי, בלי לאבד את הידע הכללי שכבר נצבר. זו הסיבה שכוונון עדין דורש בדרך-כלל הרבה פחות נתונים וכוח-חישוב מאשר אימון מודל חדש — לעיתים אלפי דוגמאות בלבד, במקום מיליארדי הדוגמאות שדרש האימון המקורי.

הגישה המסורתית לכוונון עדין, "כוונון-מלא" (Full Fine-tuning), מעדכנת את כל הפרמטרים של המודל — לעיתים מאות מיליארדי משקלים — מה שדורש חומרה יקרה ומתקדמת ברמת מרכזי-נתונים. הפריצה שהפכה כוונון עדין לנגיש הרבה יותר קרתה ב-2021, עם פרסום שיטת LoRA (ראשי-תיבות של Low-Rank Adaptation — התאמה מדרגה-נמוכה): במקום לגעת בכל משקלי המודל המקורי, LoRA "מקפיאה" אותם לגמרי ומוסיפה להם רק שכבה קטנה יחסית של פרמטרים-חדשים-לאימון, שמלמדת את ההתאמה הנדרשת. השיטה מפחיתה את מספר הפרמטרים שצריך לאמן פי אלפים, ובכך גם את דרישת הזיכרון והחומרה, בלי לפגוע משמעותית באיכות התוצאה במרבית המקרים. גרסה קיצונית עוד יותר, QLoRA (LoRA מכומת), משלבת את זה עם דחיסת-המודל המקורי לדיוק-מספרי נמוך יותר — ויחד השתיים הפכו כוונון-עדין של מודל בגודל בינוני לישים על כרטיס-מסך יחיד ברמת-צרכן, ולא רק על תשתית-ענן ארגונית.

שימושים בפועל וההבדל מהנדסת-פרומפטים ו-RAG

השימוש הנפוץ ביותר בכוונון עדין הוא התאמת מודל-בסיס כללי לתחום מקצועי צר: חברת תרופות עשויה לכוונן מודל על ספרות רפואית-מקצועית כדי לשפר דיוק במונחים קליניים, חברת-משפט עשויה לכוונן מודל על פסקי-דין כדי שיאמץ את הסגנון והמבנה המקובלים בכתיבה משפטית, וחברת-שירות-לקוחות עשויה לכוונן מודל על תמלולי-שיחות עבר כדי שיאמץ את הטון והמדיניות הספציפיים שלה. שימוש נפוץ לא-פחות הוא "כוונון-הוראות" (Instruction Tuning) — התהליך שהופך מודל-בסיס גולמי (שרק מנבא טקסט-המשך סטטיסטי) לעוזר שמגיב להוראות בצורה שימושית ובטוחה; זהו שלב-הכוונון שהופך, למעשה, מודל-שפה-גולמי למוצר כמו ChatGPT או Claude, ולרוב משולב יחד עם RLHF (למידת-חיזוק מהעדפות אנושיות) כדי לחדד עוד יותר אילו תשובות אנשים מעדיפים בפועל.

כוונון עדין הוא רק אחת משלוש דרכים עיקריות "להתאים" מודל שפה קיים למשימה ספציפית, וההבדל ביניהן מהותי. הנדסת-פרומפטים (Prompt Engineering) והרחבה כמו RAG (אחזור-מוגבר-בייצור) לא נוגעות במודל עצמו כלל — הן משנות רק את מה שמוזן אליו בזמן-השימוש. כוונון עדין, לעומת זאת, משנה בפועל את המשקלים הפנימיים של המודל, כך שההתנהגות החדשה "נטמעת" בו לצמיתות ולא צריכה להיות מוזנת-מחדש בכל שיחה. זה הופך אותו לבחירה הטובה יותר כשצריך שהמודל יאמץ סגנון או ידע קבוע ועקבי לאורך מאות-אלפי שאילתות, אבל גם לבחירה הפחות-גמישה: עדכון הידע דורש סבב-אימון חדש, בזמן ש-RAG מתעדכן ברגע שמוסיפים מסמך למאגר.

יתרון בעיצוב-התנהגות מול סיכון השכחה הקטסטרופלית

יתרון מרכזי של כוונון עדין הוא שהוא לא רק "מלמד עובדות" אלא גם מעצב התנהגות וסגנון בצורה שקשה להשיג רק בפרומפט — למשל ללמד מודל לענות תמיד במבנה קבוע, לשמור על טון ספציפי לאורך שיחה ארוכה, או להימנע מנושאים מסוימים בעקביות גבוהה יותר ממה שהוראה בפרומפט-מערכת בלבד יכולה להבטיח. מסיבה זו, מוצרים מסחריים רבים משלבים בפועל את שתי הגישות יחד: כוונון עדין ליצירת "אישיות-בסיס" עקבית, והנדסת-פרומפטים או RAG להתאמה נקודתית של כל שיחה בודדת.

עם זאת, לכוונון עדין יש סיכון ייחודי שנקרא "שכחה קטסטרופלית" (Catastrophic Forgetting): כוונון אגרסיבי-מדי על תחום צר עלול לגרום למודל "לשכוח" חלק מהיכולות הכלליות שהיו לו לפני הכוונון — למשל מודל שכוונן אינטנסיבית לכתיבה משפטית עלול להיחלש ביכולת שיחה כללית או בפתרון-בעיות מתחומים אחרים. הבעיה חמורה יותר ככל שמערך-הנתונים לכוונון קטן וממוקד יותר, וזו הסיבה שרוב הפרקטיקה המקצועית היום ממליצה על מערכי-אימון מגוונים יחסית גם בתוך כוונון ממוקד-תחום, ועל השוואה שיטתית לביצועי המודל המקורי לפני ואחרי הכוונון — לא רק בדיקת השיפור בתחום הספציפי.

איכות-נתונים קריטית, ואיך הכוונון הפך נגיש לכולם

איכות נתוני-הכוונון קריטית הרבה יותר מכמותם. מערך-נתונים קטן אך נקי ומדויק — לעיתים כמה מאות דוגמאות איכותיות בלבד — יכול לתת תוצאה טובה יותר ממערך גדול אך רועש או לא-עקבי, כי המודל "לומד" גם משגיאות ואי-דיוקים שקיימים בנתוני-הכוונון עצמם, ולא רק מהתבנית הרצויה. זו הסיבה שחלק ניכר מהעבודה בפרויקט-כוונון אמיתי מוקדש לניקוי ואימות של מערך-הנתונים, ולא רק להרצת תהליך-האימון עצמו.

נגישות כוונון עדין השתנתה דרמטית מאז 2023-2024: כלים כמו Unsloth (ספריית-קוד-פתוח שמאיצה משמעותית את מהירות-האימון) הפכו את השילוב של QLoRA עם כרטיס-מסך יחיד ברמת-צרכן — כמה מאות דוגמאות איכותיות, ואפילו כרטיס-מסך בעלות של כמה מאות דולרים בלבד — לתהליך שיכול לקחת שעות בודדות במקום שבועות, ולא לדרוש עוד תקציב-ענן ארגוני. הנגישות הזו היא הסיבה המרכזית לכך שכוונון עדין הפך משיטה שהייתה שמורה כמעט אך-ורק לחברות-ענק, לכלי סטנדרטי גם בידי צוותי-פיתוח קטנים וחוקרים עצמאיים.

כוונון ממוקד-ערכים (RLHF מול DPO) והצד האפל: עקיפת הגנות-בטיחות

לצד LoRA וכוונון-הוראות, קיימת גם קטגוריה נפרדת של כוונון שמטרתה יישור-ערכים (Alignment) — לא ללמד ידע חדש אלא לעצב אילו תשובות המודל "בוחר" לתת מבין כמה תשובות אפשריות. RLHF, השיטה המקורית והמורכבת-יותר לכך, מאמנת "מודל-תגמול" נפרד שמדרג תשובות לפי העדפה אנושית, ואז משתמשת בו כדי לכוונן את המודל הראשי בשיטת למידת-חיזוק. מאז 2023 התפתחה חלופה פשוטה משמעותית שנקראת DPO (ראשי-תיבות של Direct Preference Optimization — מיטוב-העדפה ישיר), שמשיגה תוצאה דומה בלי לאמן מודל-תגמול נפרד כלל — ישירות מתוך זוגות של "תשובה מועדפת מול תשובה פחות-מועדפת" — מה שהופך אותה לפשוטה ויציבה יותר לאימון, וגם היא, כמו LoRA, נחשבת היום לצורה של כוונון עדין ממוקד-ערכים ולא רק ממוקד-ידע.

לכוונון עדין יש גם פן מדאיג שהתגלה כשחברות AI פתחו ממשקי-כוונון לציבור הרחב: חוקרים הראו שאפשר לנצל כוונון עדין "כשירות" כדי לעקוף חלק מהגנות-הבטיחות שהוטמעו במודל המקורי — לכוונן אותו מחדש על מערך-נתונים קטן ולא-תמים-כביכול, שבפועל מחליש את הנטייה שלו לסרב לבקשות בעייתיות. הגילוי הזה חייב את חברות ה-AI המובילות להוסיף שכבות-בדיקה אוטומטיות על מערכי-הנתונים שמוזנים לשירותי-כוונון ציבוריים, ולא רק לסמוך על ההגנות שהוטמעו בשלב-האימון המקורי.

איך בודקים שכוונון עדין באמת הצדיק את עצמו

בדיקת ההצלחה של סבב-כוונון היא בעצמה שלב שקל לדלג עליו בטעות. לא מספיק לבדוק שהמודל-אחרי-כוונון "נשמע טוב" על כמה דוגמאות ידניות — צוותים מקצועיים משווים ביצועים על מערך-בדיקה שהמודל לא ראה כלל באימון, מודדים גם ירידה אפשרית ביכולות כלליות (לא רק שיפור במשימה הממוקדת), ולעיתים משווים גם מול הגישות החלופות — הנדסת-פרומפטים בלבד או RAG — לפני שמחליטים שכוונון עדין אכן הצדיק את המשאבים שהושקעו בו. במקרים רבים מתברר בבדיקה הזו שפתרון פשוט יותר, כמו פרומפט-מערכת מפורט או מאגר-RAG מעודכן, נותן תוצאה דומה בלי עלות-האימון והתחזוקה שכוונון עדין דורש. כלל-אצבע מעשי שרוב הצוותים מגיעים אליו בפועל: להתחיל תמיד מהפתרון הזול ביותר שעשוי לעבוד — הנדסת-פרומפטים, ואז RAG — ולעבור לכוונון עדין רק כשמתברר בבירור שהשניים האלה לא מספיקים למטרה הספציפית.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

ארבע דרכים להתאים מודל קיים למשימה — מהקלה ביותר לכבדה ביותר
הנדסת-פרומפטיםRAGכוונון עדין עם LoRAכוונון-מלא
מה משתנה בפועלרק מה שמוזן למודלמקור-מידע חיצוני שנוסףשכבת-פרמטרים קטנה נוספתכל משקלי המודל
עלות וזמןמיידי, כמעט חינםהקמה חד-פעמית, זולה יחסיתשעות עד ימים, זול-בינוניימים עד שבועות, יקר
דורש חומרה ייעודית?לאמסד-נתונים וקטורי בלבדכרטיס-מסך אחד לרוב מספיקאשכול שרתים בדרך-כלל
מתי הכי מתאיםהתאמה נקודתית לשיחה בודדתידע עדכני וגדול-היקףסגנון והתנהגות עקביים לאורך זמןשינוי מהותי ביכולות הבסיס

שאלות נפוצות ❓

כמה נתונים צריך בשביל כוונון עדין?

תלוי במטרה, אך לרוב הרבה פחות ממה שנדמה — לעיתים כמה מאות עד אלפי דוגמאות איכותיות מספיקות, בעיקר עם שיטות כמו LoRA.

האם כוונון עדין "מלמד" את המודל עובדות חדשות בצורה אמינה?

פחות מומלץ למטרה הזו — למידע עדכני או עובדתי-נקודתי, RAG בדרך כלל מדויק ומהימן יותר; כוונון עדין מצטיין בעיקר בעיצוב סגנון והתנהגות.

מה ההבדל בין LoRA לכוונון-מלא?

כוונון-מלא מעדכן את כל משקלי המודל; LoRA מקפיאה את המודל המקורי ומוסיפה רק שכבה קטנה של פרמטרים חדשים, ומשיגה תוצאה דומה בחלק קטן מהעלות.

האם אפשר לכוונן מודל בבית, על מחשב אישי?

כן, למודלים בגודל בינוני — עם LoRA/QLoRA וכרטיס-מסך ברמת-צרכן אחד, זה נעשה ריאלי החל מ-2024-2025.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו