דלג לתוכן

יצירת תמונה מטקסט (Text-to-Image)

תמונה, קול ווידאו

הגדרה

יצירת תמונה מטקסט (Text-to-Image) היא טכנולוגיה שהופכת תיאור מילולי לתמונה חדשה שנוצרה מאפס.

💡 דוגמה

כותבים "חתול כתום על אדן חלון בשקיעה, בסגנון ציור שמן", ומקבלים תמונה כזו תוך שניות, בלי צלם או מאייר.

מה זה בכלל: הופכים מילים לתמונה שלא הייתה קיימת

יצירת תמונה מטקסט (Text-to-Image) היא טכנולוגיה שהופכת תיאור מילולי (פרומפט) לתמונה חדשה ומקורית שנוצרת מאפס, לא נשלפת ממאגר תמונות קיים. המשתמש מקליד תיאור — למשל "חתול כתום יושב על אדן חלון בשקיעה, בסגנון ציור שמן" — והמודל מייצר תמונה תואמת תוך שניות, בלי צלם, מאייר או תוכנת-עריכה מעורבים בתהליך.

לפני הדיפוזיה: קולאז'ים, GAN, ומודל שקרא לתמונה כמו למשפט

התחום קדם בהרבה לגל-הדיפוזיה של 2022. עד אמצע שנות ה-2010 נעשה שימוש בשיטות פרימיטיביות-יחסית — הרכבת קולאז' מתמונות קיימות ממאגר קליפ-ארט, לא יצירה חדשה. ב-2015 הציג המודל AlignDRAW את הגישה המודרנית הראשונה: הרחבה של ארכיטקטורת DRAW עם מנגנון-קשב שמתנה את היצירה על רצף-הטקסט, אך התוצר הוגבל לתמונות זעירות של 32 על 32 פיקסלים ובגיוון מוגבל. ב-2016 יושמו לראשונה רשתות יריבות-גנרטיביות (GAN) על המשימה — הן הפיקו תמונות "אמינות למראה" של ציפורים ופרחים כשאומנו על מאגר-נתונים צר, אך התקשו במאגרים רחבים ומגוונים יותר. הפריצה הציבורית הראשונה הגיעה עם DALL-E של OpenAI בינואר 2021: מודל טרנספורמר אוטורגרסיבי שיצר תמונות מפרומפט על-ידי התייחסות לתמונה עצמה כרצף של "אסימונים" (tokens), בדיוק כפי שמודל-שפה מייצר משפט מילה-אחר-מילה — גישה שונה לגמרי מהדיפוזיה ששולטת בתחום היום.

איך הטקסט בכלל "מדבר" אל מודל הדיפוזיה

רוב כלי יצירת התמונות המובילים כיום — Midjourney, DALL-E 2 ואילך, Stable Diffusion — מבוססים על מודל דיפוזיה: תהליך שמתחיל מרעש אקראי ומעדן אותו בהדרגה לכדי תמונה שתואמת את התיאור שקיבל. שלב-ביניים קריטי הוא קידוד הטקסט למספרים שהמודל יכול "להבין" — משימה שמבוצעת בדרך-כלל על-ידי רשת נפרדת שאומנה להתאים בין תיאורים מילוליים לתמונות, כמו CLIP (ראשי-תיבות של Contrastive Language-Image Pre-training) של OpenAI, או מודל-שפה גדול קפוא לגמרי כפי שבחרה גוגל ב-Imagen. הקידוד הזה מוזרם לרשת-הדיפוזיה בכל צעד-עידון בעזרת שכבות תשומת-קשב-צולבת (cross-attention), שמקשרות בין כל אזור בתמונה-בהתהוות לבין המילים הרלוונטיות בתיאור. עוצמת-ההיצמדות לתיאור נשלטת בפועל על-ידי "סולם-הנחיה" (guidance scale) — ככל שהוא גבוה יותר, התמונה נאמנה יותר לפרומפט, על חשבון גיוון.

ציר-זמן: מ-DALL-E 2 ועד הדור הנוכחי

DALL-E 2 של OpenAI הוכרז באפריל 2022, בתחילה בגישה מוגבלת בלבד, והגיע לזמינות פומבית לכלל-הציבור רק ב-28 בספטמבר 2022 — אחרי שגם Midjourney (ביתא פתוחה, יולי 2022) וגם Stable Diffusion (אוגוסט 2022) כבר היו זמינים לציבור הרחב. שלושת הכלים יחד, תוך פחות משנה מההכרזה הראשונה על DALL-E 2, הפכו את יצירת-התמונות-בבינה-מלאכותית מתחום-מחקר-נישתי לכלי צריכה-המונית עם עשרות מיליוני משתמשים. הנוף המשיך להתרחב: Black Forest Labs שחררה באוגוסט 2024 את FLUX, שגרסתו הקלה (Schnell) יצאה ברישיון קוד-פתוח מלא, ומ-2025 ואילך מציעה OpenAI יצירת-תמונות משופרת ישירות בתוך ChatGPT תחת השם GPT Image.

מגבלות ומחלוקת: אצבעות, טקסט וזכויות-יוצרים

האיכות והדיוק של הפלט תלויים מאוד באיכות התיאור שניתן — כלי יצירת תמונות מבינים היום גם ניואנסים סגנוניים, טכניים (תאורה, זווית צילום) וקומפוזיציוניים, לא רק תיאור-אובייקטים גולמי. עדיין קיימות מגבלות ידועות: המודלים מתקשים לעיתים בפרטים עדינים כמו מספר-אצבעות נכון בכף-יד או טקסט קריא בתוך התמונה, ואימונם על מיליארדי תמונות שנאספו מהאינטרנט — כמו מאגר LAION-5B, המכיל מעל 5 מיליארד זוגות תמונה-כיתוב — מעורר דיון מתמשך על זכויות-יוצרים של אמנים שיצירותיהם שימשו לאימון בלי הסכמה מפורשת.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

דיפוזיה מול גישה אוטורגרסיבית מול GAN בייצור תמונה מטקסט
דיפוזיהאוטורגרסיבי (כמו DALL-E הראשון)GAN
איך התמונה נבניתבהדרגה, מרעש מלא לתמונה נקייה, בעשרות-מאות צעדיםפיקסל-אחר-פיקסל או אסימון-אחר-אסימון, ברצף כמו טקסטבצעד יצירה חישובי יחיד מווקטור-רעש
מהירות ייצוראיטית יחסית — תלויה במספר-הצעדיםאיטית מאוד — רצף ארוך של תחזיות עוקבותמהירה — צעד חישובי בודד
יציבות-אימוןיציבה יחסית, והודגם שהיא עולה על GAN באיכות-דגימה (2021)יציבה, אך פחות יעילה חישובית ממודלים גנרטיביים אחריםידועה כקשה-לאימון ורגישה לקריסת-מצבים (mode collapse)
דוגמה מוכרתStable Diffusion, DALL-E 2 ואילך, MidjourneyDALL-E המקורי (2021)StyleGAN

שאלות נפוצות ❓

האם יצירת-תמונה-מטקסט זהה למודל-דיפוזיה?

לא בדיוק — דיפוזיה היא הטכניקה השולטת היום ביצירת-תמונה-מטקסט, אבל התחום עצמו קדם לה: מודלים אוטורגרסיביים כמו DALL-E המקורי (2021) ורשתות-GAN (מ-2016) ניסו לפתור את אותה משימה בשיטות שונות לגמרי.

איך המודל בכלל "מבין" את הטקסט שהקלדתי?

רשת נפרדת שאומנה להתאים בין תיאורים לתמונות — כמו CLIP של OpenAI, או מודל-שפה גדול קפוא כמו ב-Imagen של גוגל — מקודדת את הטקסט למספרים, ושכבות תשומת-קשב-צולבת מזרימות את הקידוד הזה לרשת-הדיפוזיה בכל צעד-עידון.

למה כלי-יצירת-תמונות עדיין מתקשים בציור ידיים וטקסט?

אלו פרטים עדינים שדורשים דיוק גיאומטרי ורציפות לוגית (כמו איות נכון), בעוד שהמודל למד בעיקר דפוסים חזותיים סטטיסטיים ממיליארדי תמונות — לא כללים מדויקים. הפער הצטמצם עם הדורות החדשים, אך לא נעלם.

מה המחלוקת סביב LAION-5B וזכויות-יוצרים?

מודלים רבים אומנו על מאגר LAION-5B, שמכיל מעל 5 מיליארד זוגות תמונה-כיתוב שנאספו מהאינטרנט — כולל יצירות של אמנים שלא נתנו הסכמה מפורשת לשימוש בעבודתם לאימון, מה שמעורר דיון משפטי ואתי מתמשך.

מה זה "סולם-הנחיה" (guidance scale)?

פרמטר שקובע כמה חזק המודל "נצמד" לתיאור-הטקסט בזמן היצירה: ערך גבוה מייצר תמונה נאמנה יותר לפרומפט אך פחות מגוונת, וערך נמוך יותר מגוון אך פחות מדויק.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו