יצירת וידאו מטקסט (Text-to-Video)

תמונה, קול ווידאו

יצירת וידאו מטקסט (Text-to-Video) היא טכנולוגיה חדשה יחסית שיוצרת קטעי וידאו קצרים ישירות מתיאור מילולי — ללא צילום, שחקנים, או ציוד הפקה כלל.

מבחינה טכנית, רוב כלי הווידאו מבוססי-AI מרחיבים את עקרון מודל הדיפוזיה מתמונה בודדת לרצף פריימים עקבי — אתגר משמעותית קשה יותר, כי צריך לשמור על עקביות (אותה דמות, אותו רקע) לאורך זמן, לא רק תמונה סטטית אחת.

התחום עדיין בשלבים מוקדמים יחסית לעומת יצירת תמונות — קטעי הווידאו בדרך כלל קצרים, ולעיתים עדיין מציגים חוסר-עקביות פיזי או ויזואלי — אבל מתקדם במהירות רבה, עם שיפורים ניכרים כמעט מדי חודשים.