מודל דיפוזיה (Diffusion Model)
הגדרה
מודל דיפוזיה (Diffusion Model) הוא הטכניקה שמאחורי רוב כלי יצירת התמונות של היום — המודל מעדן רעש אקראי בהדרגה לכדי תמונה, לפי תיאור טקסטואלי.
💡 דוגמה
התמונה מתחילה כ"שלג" של טלוויזיה ישנה, ובכל צעד הרעש מתבהר קצת, עד שמופיעה התמונה שביקשתם.
התהליך בשני כיוונים: מרעש לתמונה, ותמונה לרעש
מודל דיפוזיה (Diffusion Model) הוא הטכניקה שמאחורי רוב כלי יצירת התמונות המובילים של היום — Midjourney, DALL-E, Stable Diffusion ואחרים. תהליך היצירה מתחיל מ"רעש" חזותי אקראי לחלוטין — משהו שנראה כמו סטטיק של טלוויזיה ישנה — ומעדן אותו בהדרגה, בעשרות או מאות צעדים קטנים, עד שמתקבלת תמונה ברורה שתואמת את התיאור הטקסטואלי שקיבל המודל.
איך המודל בכלל לומד לעשות תהליך כזה? באימון קורה תהליך הפוך, שנקרא "תהליך-קדימה": לוקחים תמונה אמיתית ומוסיפים לה רעש גאוסי בהדרגה, צעד אחר צעד לפי לוח-זמנים קבוע-מראש, עד שהתמונה המקורית נעלמת לגמרי ונשאר רק רעש טהור. "תהליך-אחורה" הוא ההפך: התחלה מרעש טהור, והסרתו בהדרגה עד שנשארת תמונה. המודל לא צריך ללמוד לצייר תמונה שלמה בבת-אחת — רק לחזות, בכל צעד בודד, כמה בדיוק רעש נוסף באותו צעד באימון, ומהתשובה הזו לבצע את התהליך בכיוון ההפוך.
התרגיל שהפך לסטנדרט: DDPM, וחיזוי-רעש במקום ציור-ישיר
הנוסחה שהפכה לסטנדרט-התעשייה הגיעה במאמר "Denoising Diffusion Probabilistic Models" (בקיצור DDPM) של ג'ונתן הו, אג'יי ג'יין ופיטר אבביל מ-2020. החידוש שלהם היה פשטני להפליא: במקום לאמן רשת שמנבאת ישירות את התמונה הנקייה או את ההתפלגות המלאה של הצעד הבא, מספיק לאמן אותה לחזות רק את וקטור-הרעש שנוסף בכל צעד — ולמזער את הפער בין הרעש שהיא ניחשה לרעש שבאמת נוסף. הפישוט הזה, שנשען על רשת מסוג U-Net או טרנספורמר, הניב בפועל תמונות איכותיות יותר מהניסוח המדויק-מתמטית יותר שקדם לו. מבחינה מתמטית, מודלים כאלה שקולים למשפחה מקבילה שנקראת "מודלים מבוססי-ציון" (Score-Based Models, לפי יאנג סונג וסטפנו ארמון), שלומדים את הגרדיאנט של הסתברות-הלוג של הנתונים ודוגמים ממנו בעזרת דינמיקת לנז'ווין — שני ניסוחים שונים לאותו רעיון.
דוגמה: Stable Diffusion והדיפוזיה הסמויה
דוגמה קונקרטית: Stable Diffusion, שפיתחה חברת Stability AI ופרסמה באוגוסט 2022, הייתה מודל יצירת-התמונות הגדול הראשון שקוד-המקור והמשקלים שלו שוחררו בפומבי, בשונה מ-DALL-E ומ-Midjourney הסגורים שקדמו לה — צעד שהנגיש יצירת-תמונות באיכות-גבוהה לכל מפתח, בלי תלות בשירות מסחרי סגור, והאיץ משמעותית את קצב-החדשנות בתחום. המאמר האקדמי שמאחוריו, "High-Resolution Image Synthesis with Latent Diffusion Models" (רומבך ואחרים, 2022), הציג חידוש מרכזי: הרצת תהליך-הדיפוזיה במרחב-סמוי דחוס במקום ברמת-הפיקסלים הגולמית, מה שהוזיל דרמטית את עלות-החישוב הנדרשת.
למה דיפוזיה ניצחה את ה-GAN, ואיך מאיצים אותה
ב-2021 הראו פראפולה דהריוואל ואלכס ניקול, בעבודה שכותרתה במפורש "Diffusion Models Beat GANs on Image Synthesis", שמודלי-דיפוזיה עולים על רשתות יריבות-גנרטיביות (GAN) באיכות-הדגימה, תוך שימוש בטכניקה שנקראה "הנחיית-מסווג" (classifier guidance) לשיפור נאמנות הפלט לקטגוריה המבוקשת. ב-2022 הציגו ג'ונתן הו וטים סלימנס גרסה פשוטה יותר, "הנחיה חסרת-מסווג" (classifier-free guidance): אימון משותף של גרסת-המודל המותנית והבלתי-מותנית, ושילוב שתי התחזיות שלהן בזמן-הדגימה כדי לשלוט על מידת-הנאמנות של התמונה לתיאור הטקסטואלי — בלי צורך במסווג נפרד בכלל. שיטת-הדגימה DDIM מאיצה את התהליך בכיוון אחר: היא מדלגת על חלק מהצעדים הקטנים, כך שאפשר להגיע לתמונה סופית בעשרות צעדים בלבד במקום במאות, במחיר קטן באיכות.
מגבלות, והתפשטות מעבר לתמונות סטטיות
למודלי דיפוזיה יש גם מגבלות ידועות. הריצה המקורית דורשת עשרות או מאות צעדי-עידון סדרתיים, כך שיצירת תמונה בודדת יכולה לקחת שניות ארוכות עד דקות — משמעותית איטי יותר מהמתחרה ההיסטורית העיקרית, רשת יריבה-גנרטיבית (GAN), שמייצרת תמונה בצעד חישובי בודד אך התקשתה לשמור על יציבות-אימון דומה. שיטות-האצה כמו "זיקוק" (Distillation) צמצמו את הפער הזה בשנים האחרונות. עקרון הרעש-ההדרגתי-ההפוך עצמו כבר לא מוגבל לתמונות סטטיות: אותה שיטה בדיוק מייצרת היום גם קטעי וידאו (למשל Sora של OpenAI) וקטעי שמע/מוזיקה, פשוט על סוג-נתונים שונה.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
שאלות נפוצות ❓
איך מודל דיפוזיה לומד ליצור תמונה, בלי לראות תמונה שלמה בבת-אחת?
באימון מוסיפים לתמונות אמיתיות רעש גאוסי בהדרגה עד שהן הופכות לרעש טהור, והמודל לומד לחזות רק את הרעש שנוסף בכל צעד בודד — לא את התמונה השלמה. ברגע שהוא יודע לחזות רעש בצעד יחיד, הוא מפעיל את אותו ניחוש שוב ושוב בכיוון ההפוך, מרעש טהור עד תמונה.
מה זה DDPM ולמה זה נחשב לפריצת-דרך?
Denoising Diffusion Probabilistic Models (2020), של ג'ונתן הו ועמיתיו, הראה שמספיק לאמן רשת לחזות את וקטור-הרעש שנוסף בכל צעד, ולא את ההתפלגות המדויקת של הצעד הבא — פישוט שהניב בפועל תמונות איכותיות יותר, והפך לנוסחת-הבסיס של רוב מודלי-הדיפוזיה שבאו אחריו.
למה דיפוזיה ניצחה את ה-GAN כשיטת-הבחירה ליצירת תמונות?
מחקר מ-2021 של דהריוואל וניקול הראה שמודלי-דיפוזיה עולים על GAN באיכות-דגימה, ובניגוד ל-GAN הידוע כקשה-לאימון ולא-יציב, אימון-דיפוזיה יציב יותר — במחיר של תהליך-ייצור איטי בהרבה, שדורש עשרות עד מאות צעדים במקום צעד חישובי בודד.
מה זה "הנחיה חסרת-מסווג" (Classifier-Free Guidance)?
טכניקה מ-2022 של הו וסלימנס: המודל מאומן בו-זמנית בגרסה מותנית (עם תיאור-טקסט) ובגרסה בלתי-מותנית, ובזמן היצירה משלבים את שתי התחזיות כדי לשלוט על מידת-הנאמנות של התמונה לתיאור — בלי לדרוש מסווג נפרד כמו בשיטות הקודמות.
האם דיפוזיה מוגבלת ליצירת תמונות בלבד?
לא. אותו עיקרון של רעש-הדרגתי-ומהופך משמש היום גם ליצירת וידאו (כמו Sora של OpenAI) ושמע/מוזיקה — רק סוג-הנתונים שעליו מופעל התהליך משתנה.