יצירת וידאו מטקסט (Text-to-Video)
הגדרה
יצירת וידאו מטקסט (Text-to-Video) היא טכנולוגיה חדשה יחסית שיוצרת קטעי וידאו קצרים ישירות מתיאור מילולי.
יצירת וידאו מטקסט (Text-to-Video) הוא טכנולוגיה חדשה יחסית שיוצרת קטעי וידאו קצרים ישירות מתיאור מילולי — ללא צילום, שחקנים, או ציוד-הפקה כלל. המשתמש מקליד תיאור-סצנה, והמודל מפיק קובץ-וידאו שלם — תנועה, תאורה, ולעיתים גם פסקול-שמע תואם — תוך דקות ספורות.
מבחינה טכנית, רוב כלי הווידאו מבוססי-AI מרחיבים את עקרון מודל הדיפוזיה מתמונה בודדת לרצף פריימים עקבי — אתגר משמעותית קשה יותר, כי צריך לשמור על עקביות (אותה דמות, אותו רקע) לאורך זמן, לא רק תמונה סטטית אחת. הפתרון הנפוץ כיום הוא ארכיטקטורת "דיפוזיה-טרנספורמר" (Diffusion Transformer), שמפרקת את הווידאו ליחידות-מרחב-זמן קטנות ומעדנת את כולן יחד, כך שהתנועה נשארת פיזיקלית-הגיונית לאורך כל הקליפ.
דוגמה קונקרטית להתפתחות המהירה של התחום: Sora של OpenAI, שהוצגה בפברואר 2024 ויצאה לציבור בדצמבר אותה שנה, הדגימה לראשונה קטעי-וידאו איכותיים באורך של עד דקה — אבל גם המחישה כמה התחום תנודתי: מספר-המשתמשים ירד מכמיליון לפחות מ-500,000 תוך פחות משנה, ועלות-תפעול של כמיליון דולר ליום הובילה את OpenAI להודיע במרץ 2026 על סגירת Sora; האתר והאפליקציה הופסקו בפועל באפריל אותה שנה, וה-API שלה מתוכנן להיסגר בספטמבר 2026. באותו זמן, Google Veo (הוצג מאי 2024) התבסס דווקא כמתחרה יציב — גרסה 3, ממאי 2025, הוסיפה יצירת-פסקול-שמע מסונכרן (דיאלוג ואפקטים) לצד הווידאו עצמו, לא רק תמונה נעה.
התחום עדיין בשלבים מוקדמים יחסית לעומת יצירת תמונות — קטעי הווידאו בדרך-כלל קצרים (שניות בודדות עד דקה), ולעיתים עדיין מציגים חוסר-עקביות פיזי או ויזואלי, כמו אצבעות שמתמזגות או חפצים שנעלמים בין פריימים. עם זאת התחום מתקדם במהירות רבה, עם שיפורים ניכרים כמעט מדי חודשים, ומגוון-שימושים שכבר כולל הפקות-קולנוע וטלוויזיה לגיטימיות לצד ניצול-לרעה מתועד ליצירת תוכן-תעמולה בעיצומם של סכסוכים מזוינים — ומעורר גם דיונים על זכויות-יוצרים ואמינות-תוכן, קשורים ישירות לדיון על דיפ-פייק.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות