DALL-E — מודל ליצירת-תמונה; שמו מצרף את WALL-E והצייר דאלי

תמונה, קול ווידאו

הגדרה

DALL-E הוא מודל של OpenAI ליצירת תמונה מטקסט, שהוצג בינואר 2021 כגרסה מותאמת של GPT-3 — אחד הכלים הראשונים שהפכו יצירת-תמונות מבוססת-בינה-מלאכותית לנגישה לציבור הרחב.

OpenAI חשפה את DALL-E ב-5 בינואר 2021: מודל בעל 12 מיליארד פרמטרים, גרסה מותאמת של GPT-3 שאומנה ליצור תמונות מתוך תיאור טקסטואלי במקום להמשיך טקסט קיים. שם הכלי הוא צירוף של הרובוט-האנימציה WALL-E מסרטי פיקסר והצייר הסוריאליסטי הספרדי סלוודור דאלי — רמיזה מכוונת לשילוב בין טכנולוגיה לדמיון-אמנותי. הגרסה הראשונה נותרה זמינה בעיקר לחוקרים ולתפקידי-הדגמה, ולא נפתחה מיד לציבור הרחב כמוצר-צריכה.

מבחינה אדריכלית, DALL-E הוא מודל-שפה מסוג טרנספורמר, לא מודל-דיפוזיה: הוא מקבל טקסט ותמונה כזרם אחד של עד 1,280 טוקנים (256 לטקסט, 1,024 לתמונה), ולומד לחזות את כל הטוקנים ברצף אחד אחרי השני — בדיוק כפי שהוא לומד לחזות טקסט רגיל. מתוך כל הנחיה מייצר המודל 512 גרסאות מועמדות, ומדרג אותן מחדש באמצעות מודל CLIP כדי לבחור את 32 התוצאות המשכנעות ביותר להצגה.

ב-6 באפריל 2022 הכריזה OpenAI על DALL-E 2, שנפתח לביתא מוגבלת ב-20 ביולי ולכלל הציבור ב-28 בספטמבר אותה שנה. הגרסה נטשה את ארכיטקטורת הטרנספורמר לטובת מודל-דיפוזיה המותנה על ייצוגי-CLIP, עם 3.5 מיליארד פרמטרים בלבד — פחות מהמקור — ולפי OpenAI ייצרה תמונות ריאליסטיות יותר ברזולוציה גבוהה פי-4 מהגרסה המקורית. DALL-E 3 שולב ישירות בתוך ChatGPT באוקטובר 2023, בלי צורך בממשק נפרד.

DALL-E הוקדם משמעותית ביחס להשקת Stable Diffusion (אוגוסט 2022) ולביתא הפתוחה של Midjourney (יולי 2022), ונחשב לאחד הכלים הראשונים שהראו לציבור הרחב שיצירת-תמונה מטקסט אפשרית בכלל — שלושתם יחד הביאו את התחום הרחב של אמנות בינה מלאכותית (AI Art) לתודעה הציבורית. בשונה משני אלה, נותר, לפחות בשלב המוקדם, כלי סגור וזמין רק דרך OpenAI — בהתאם לגישה הכללית של החברה למוצריה. פרטים נוספים על החברה שמאחוריו, כולל תולדותיה והמוצרים הנוספים שפיתחה, מופיעים בערך שלה.