מודל דיפוזיה (Diffusion Model)
מודל דיפוזיה (Diffusion Model) הוא הטכניקה שמאחורי רוב כלי יצירת התמונות המובילים של היום — Midjourney, DALL-E, Stable Diffusion ואחרים. תהליך היצירה מתחיל מ"רעש" חזותי אקראי לחלוטין — משהו שנראה כמו סטטיק של טלוויזיה ישנה — ומעדן אותו בהדרגה, בעשרות או מאות צעדים קטנים, עד שמתקבלת תמונה ברורה שתואמת את התיאור הטקסטואלי שקיבל המודל.
איך המודל בכלל לומד לעשות תהליך כזה? באימון, קורה תהליך הפוך: לוקחים תמונות אמיתיות, ומוסיפים להן רעש בהדרגה, צעד אחר צעד, עד שהתמונה המקורית נעלמת לגמרי ונשאר רק רעש טהור. המודל לומד לזהות בדיוק כמה רעש נוסף בכל צעד — וברגע שהוא יודע את זה, הוא יכול לבצע את התהליך בכיוון ההפוך: להתחיל מרעש טהור, ולהסיר אותו בהדרגה עד שנשארת תמונה.
אותו עיקרון — למידת התהליך ההפוך של הוספת-רעש-הדרגתית — עובד גם מעבר לתמונות: מודלי דיפוזיה מייצרים היום גם קטעי וידאו קצרים וגם קטעי שמע/מוזיקה, באותה שיטה בדיוק, רק על סוג נתונים שונה.