ההגדרה: ללמוד את ההתפלגות, לא רק את הגבול
מודל גנרטיבי הוא מודל למידת-מכונה שמנסה ללמוד איך נראים הנתונים עצמם — במונחים סטטיסטיים, את התפלגות-ההסתברות שמהם הגיעו הדוגמאות שראה באימון. ברגע שהוא למד את ההתפלגות הזו, הוא יכול "לדגום" ממנה דוגמאות חדשות שלא הופיעו באימון במדויק, אך דומות סטטיסטית לנתוני-האימון. זה שונה מהותית ממודל מבחין (Discriminative Model), שלא מנסה להבין איך הנתונים "נוצרו" בכלל — הוא רק לומד את קו-הגבול הישיר בין קטגוריות, למשל בין תמונת-חתול לתמונת-כלב, בלי לדעת לצייר אף אחד משניהם.
מושג ותיק, לא המצאה של עידן ה-LLM
בניגוד לרושם הנפוץ, מודל גנרטיבי אינו מושג שהומצא עם GAN או ChatGPT — הוא ותיק בהרבה. סיווג בייסיאני נאיבי, אחת השיטות הקלאסיות והפשוטות ביותר בלמידת-מכונה, הוא מודל גנרטיבי לכל דבר: הוא לומד איך נראית התפלגות-המילים בכל קטגוריה (למשל דואר-זבל מול דואר-לגיטימי), ומשתמש בכך כדי לסווג הודעה חדשה. מודל מרקוב חבוי (HMM), שהיה הבסיס לזיהוי-דיבור ולזיהוי-כתב-יד עוד לפני עידן הלמידה-העמוקה, גם הוא מודל גנרטיבי קלאסי. שני אלה קדמו בעשרות שנים לגל הנוכחי של מודלים גנרטיביים מבוססי-רשתות-נוירונים.
המשפחה המודרנית: GAN, דיפוזיה ומודלי-שפה
כל מודלי הבינה המלאכותית היוצרת המוכרים היום הם, מבחינה טכנית, מודלים גנרטיביים — רק עם שיטות-אימון שונות להפקת הדוגמאות. רשת יריבה גנרטיבית (GAN) לומדת ליצור דוגמאות דרך תחרות בין שתי רשתות; מודל דיפוזיה לומד ליצור דוגמאות דרך עידון-הדרגתי של רעש; מודל שפה גדול (LLM) לומד ליצור דוגמאות-טקסט דרך ניחוש-המילה-הבאה ברצף, שוב ושוב. שלושתם שונים מאוד מבחינה טכנית וארכיטקטונית, אך כולם חולקים את אותה מטרה בסיסית שמגדירה מודל גנרטיבי: ללמוד את התפלגות-הנתונים כדי להפיק ממנה דוגמאות חדשות, לא רק לסווג דוגמאות קיימות.
יתרון וחיסרון: פחות דיוק, יותר יעילות-נתונים
מחקר-יסוד משנת 2001 מאת אנדרו נג ומייקל ג'ורדן השווה ישירות בין מודל גנרטיבי למודל מבחין על אותה משימת-סיווג בדיוק, ומצא תבנית מעניינת: כשיש מעט נתוני-אימון, מודל גנרטיבי נוטה להגיע לדיוק גבוה יותר, כי הוא "יודע יותר" על המבנה הכללי של הנתונים ולא רק על קו-הגבול הצר; אבל כשכמות-הנתונים גדלה, מודל מבחין בדרך-כלל משיג את הדיוק הגבוה יותר בטווח-הארוך. הפשרה הזו — יעילות-נתונים מול תקרת-דיוק — היא אחד השיקולים המעשיים המרכזיים בבחירה בין הגישות, גם היום.
מקודד אוטומטי וריאציוני: מקודד שהפך לגנרטיבי
לא כל ארכיטקטורה נולדה גנרטיבית מלכתחילה. מקודד אוטומטי (Autoencoder), למשל, במקור נועד רק לדחוס ולשחזר נתונים קיימים — לא ליצור חדשים. הגרסה ה"וריאציונית" שלו (VAE), שהוצגה ב-2013, הוסיפה רכיב הסתברותי לייצוג הפנימי של הרשת, וכך הפכה אותו למודל גנרטיבי לכל דבר: מסוגל לא רק לשחזר קלט קיים, אלא גם לדגום ולייצר דוגמאות חדשות ומקוריות מהמרחב הפנימי שלמד. הדוגמה הזו ממחישה שהיכולת הגנרטיבית היא תכונה שניתן להוסיף לארכיטקטורות קיימות, לא רק תכונה מובנית-מראש.