זיקוק מודל (Model Distillation)
הגדרה
זיקוק מודל הוא אימון מודל קטן וזול-לתפעל ("תלמיד") לחקות את ההתנהגות של מודל גדול ויקר יותר ("מורה") — מייצר מודל מהיר וקומפקטי כמעט באותה איכות.
במקום ללמד את המודל הקטן ישירות מנתונים גולמיים, הוא לומד לחקות את הפלטים (או ההסתברויות הפנימיות) של המודל הגדול על אותם קלטים — "לומד מהמורה" במקום מהעולם ישירות.
הרעיון הוצג לראשונה ב-2015 במאמר משפיע של ג'פרי הינטון ושותפיו, שטבע את המונח "זיקוק" (Distillation) בהשאלה מכימיה — הפקת "תמצית" מזוקקת מתוך תערובת מורכבת יותר.
דוגמה עדכנית ובולטת: כש-DeepSeek פרסמה את מודל-ההיגיון R1 שלה (ינואר 2025), היא פרסמה לצידו גם כמה גרסאות מזוקקות קטנות בהרבה — מבוססות על מודלים קיימים אחרים (כמו Llama ו-Qwen) שאומנו לחקות את דפוסי-ההיגיון של R1 המקורי. הגרסאות המזוקקות הללו רצות מהר בהרבה על חומרה חלשה בהרבה, תוך שמירה על חלק ניכר מיכולת-ההיגיון של המודל-המורה.
דוגמה מוקדמת ומוכרת נוספת: DistilBERT, שפרסמה Hugging Face כבר ב-2019, זיקק את מודל BERT — Bidirectional Encoder Representations from Transformers — של Google לגרסה קטנה בכ-40% מהמקור ומהירה כמעט פי שניים, תוך שמירה על כ-97% מיכולתו על מבחני-הבנת-שפה סטנדרטיים.
זיקוק שונה מכימות (ראו הערך) בעיקרון-הפעולה: כימות מקטין את הדיוק המספרי של אותו מודל בדיוק, בעוד זיקוק מאמן רשת קטנה ושונה-לגמרי מאפס. בפועל, שתי הטכניקות משמשות לעיתים קרובות יחד — קודם מזקקים למודל קטן יותר, ואז מכמתים גם אותו, לביצועים מקסימליים על חומרה מוגבלת. התוצאה הסופית: מודל קטן שמריץ הרבה יותר מהר וזול מהמודל המקורי, תוך שמירה על חלק ניכר מהיכולת שלו — פשרה נפוצה כשצריך להריץ AI במכשירים קטנים או בקנה-מידה עצום. ככל שמודלי-הדגל גדלים ועלות-ההרצה שלהם עולה, זיקוק הופך לכלי-עסקי חשוב לא פחות מכלי-מחקרי — חברות רבות מציעות ללקוחותיהן גרסה "קלה" ומזוקקת של המודל המלא, זולה משמעותית לשימוש בקנה-מידה גדול.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות