Stable Diffusion — מודל-דיפוזיה שרץ על כרטיס-מסך ביתי, בזכות מרחב דחוס

תמונה, קול ווידאו

הגדרה

Stable Diffusion הוא מודל דיפוזיה ליצירת תמונה מטקסט, שפותח על ידי חוקרים מ-CompVis ו-Runway ופורסם על ידי Stability AI באוגוסט 2022 בקוד ובמשקלים פתוחים לחלוטין — מהלך יוצא-דופן בתחום.

מקור אקדמי: מ-CompVis ו-Runway ל-Stability AI

Stable Diffusion פותח מתוך מחקר אקדמי: קבוצת CompVis באוניברסיטת מינכן (LMU Munich), בשיתוף חברת Runway, פרסמה בדצמבר 2021 מאמר (שהוצג רשמית בכנס CVPR 2022) על "מודלי-דיפוזיה-לטנטית" (Latent Diffusion Models) — בהובלת רובין רומבך ופטריק אסר, שביניהם ועוד שני שותפים-למחקר הצטרפו מאוחר יותר לצוות Stability AI. החברה מימנה את המשך-הפיתוח והוציאה את המודל לציבור ב-22 באוגוסט 2022, בקוד ובמשקלים פתוחים לחלוטין — צעד יוצא-דופן ביחס למתחרות שהפעילו מודלים דומים כשירות סגור בלבד.

דיפוזיה במרחב-לטנטי: החידוש הטכני

החידוש הטכני המרכזי הוא עבודה במרחב-לטנטי דחוס, במקום ישירות על פיקסלים — מה שמקטין דרמטית את עלות-החישוב הנדרשת ביחס למודלי-דיפוזיה קודמים, ומאפשר הרצה על כרטיס-מסך ביתי רגיל עם פחות מ-10 ג'יגהבייט זיכרון, ויצירת תמונה תוך שניות בודדות במקום דקות. הגרסה המקורית כללה כ-860 מיליון פרמטרים ברשת ה-U-Net ועוד 123 מיליון במקודד-הטקסט; גרסת XL, שיצאה ביולי 2023, הגדילה את היקף המודל ל-3.5 מיליארד פרמטרים.

LAION: מאגר-האימון שמאחורי המודל

האימון של הגרסה המקורית התבסס על LAION-Aesthetics — תת-קבוצה מסוננת מתוך LAION-5B, מאגר-הנתונים הענקי של ארגון LAION הגרמני ללא-מטרות-רווח, שנבחרה במיוחד כדי להעדיף תמונות עם ציון-אסתטיקה גבוה. הקשר בין השניים אינו מקרי בלבד: Stability AI מימנה חלק מעבודת-הסינון של LAION-5B, ומאמר-המחקר הרשמי של LAION-5B מציין את Stable Diffusion כאחת הדוגמאות המרכזיות למודלים ש"שוכפלו בהצלחה" באמצעות המאגר.

רישיון פתוח והשפעה על התעשייה

הרישיון השתנה עם הזמן: עד גרסה 3 (פברואר 2024) פעל המודל תחת Creative ML OpenRAIL-M, רישיון-AI-אחראי מוקדם; מגרסה 3.5, שיצאה באוקטובר 2024, עבר Stable Diffusion ל"Stability AI Community License" משלה, שמחייב רישיון עסקי נפרד מחברות עם הכנסה שנתית מעל מיליון דולר. בזכות הפתיחות המוקדמת הפך הכלי לתשתית משותפת לענף שלם של גרסאות-מכוונות (Fine-tunes) וכלים נגזרים, הרבה מעבר למוצרי Stability AI עצמה — פירוט נוסף על החברה שמאחוריו מופיע בערך שלה.

שאלות נפוצות ❓

מתי ומי פרסם את Stable Diffusion?

המודל פותח על ידי חוקרים מ-CompVis (אוניברסיטת מינכן) ו-Runway, בהובלת רובין רומבך ופטריק אסר; Stability AI מימנה את הפיתוח והוציאה אותו לציבור ב-22 באוגוסט 2022, בקוד ובמשקלים פתוחים.

מה ההבדל הטכני בין Stable Diffusion למודלי-דיפוזיה קודמים?

הוא פועל במרחב-לטנטי דחוס במקום ישירות על פיקסלים, מה שמקטין דרמטית את עלות-החישוב ומאפשר הרצה על כרטיס-מסך ביתי רגיל, במקום שרתי-ענק בלבד.

מה הקשר בין LAION ל-Stable Diffusion?

המודל אומן על LAION-Aesthetics, תת-קבוצה מסוננת מתוך מאגר LAION-5B; Stability AI אף מימנה חלק מעבודת-הסינון של המאגר עצמו — קשר ישיר, לא רק כללי.

האם Stable Diffusion חינמי לשימוש מסחרי?

תלוי בגרסה ובהיקף השימוש: עד גרסה 3 חל רישיון OpenRAIL-M, ומגרסה 3.5 (אוקטובר 2024) חל Stability AI Community License, שמחייב רישיון עסקי נפרד מחברות עם הכנסה שנתית מעל מיליון דולר.