למה וידאו פיגר מאחורי תמונה וטקסט
יצירת-וידאו מבוססת-AI נחשבה עד לפני זמן קצר יחסית מפגרת משמעותית אחרי יצירת-תמונה וטקסט, מסיבה הנדסית פשוטה: מודל-תמונה צריך לייצר פריים אחד עקבי, ומודל-וידאו צריך לשמור על עקביות — אותה דמות, אותו רקע, אותה תאורה — לאורך מאות פריימים ברצף, תוך שמירה על תנועה שמתנהגת כמו פיזיקה אמיתית. הפער הזה נסגר במהירות יוצאת-דופן החל מ-2024, כשכמה חברות שונות פרסמו, בטווח של חודשים ספורים זו מזו, מודלים שמתיימרים לפתור בדיוק את הבעיה הזו — כל אחת בדרכה.
2024: הזינוק — Runway, Luma, Kling ו-Meta
Dream Machine של Luma Labs יצא ב-12 ביוני 2024, וחמישה ימים אחר-כך, ב-17 ביוני, פרסמה Runway את Gen-3 Alpha. בין לבין, ב-10 ביוני 2024, חשפה הענקית הסינית Kuaishou את Kling — מודל שיודע ליצור עד שתי דקות וידאו ברזולוציית 1080p ובקצב 30 פריימים-לשנייה, זמין תחילה לבדיקה בתוך אפליקציית-העריכה KuaiYing שלה. ב-4 באוקטובר 2024 הצטרפה גם מטא עם Movie Gen — מודל שמייצר עד 16 שניות וידאו ב-16 פריימים-לשנייה, עם שמע-סביבתי מסונכרן שיכול להימשך עד 45 שניות — אך בשונה מהשאר הציגה אותו מטא כמחקר בלבד, בדרך ל'שחרור עתידי אפשרי', ולא פתחה אותו לציבור הרחב.
Sora של OpenAI: הפריצה, ואז ההיפוך
OpenAI חשפה את Sora ב-15 בפברואר 2024 (ראו הערך הייעודי לו לפרטים המלאים על הארכיטקטורה וההיסטוריה). הגרסה הציבורית הראשונה יצאה רק בדצמבר אותה שנה, ול-Sora 2, אפליקציה חברתית עצמאית, הצטרפה בספטמבר 2025 — אבל השימוש בה צנח, ולפי תחקיר של Wall Street Journal עלות-ההרצה עמדה על כמיליון דולר ליום, ובמרץ 2026 הודיעה OpenAI על סגירתה. Sora הפסיקה לפעול בפועל ב-26 באפריל 2026, וה-API שלה מתוכנן להיסגר ב-24 בספטמבר 2026. הסגירה הזו היא חלק בלתי-נפרד מהמרוץ: היא ממחישה שאפילו השחקן שפתח את התחום פומבית יכול לצאת ממנו תוך שנתיים בלבד.
Veo של גוגל: שילוב-שמע ואינטגרציה במארג-המוצרים
גוגל דיפמיינד הציגה את Veo במאי 2024, ופיתחה אותו במהירות: Veo 2 (דצמבר 2024) הוסיף תמיכה ב-4K, ו-Veo 3, שהושק ב-20 במאי 2025 בכנס Google I/O, היה החידוש המשמעותי ביותר — לראשונה במשפחת Veo, ולמעשה המודל המסחרי הרחב הראשון שמייצר גם פסקול מסונכרן הכולל דיבור: 'רעשי-תנועה ברקע של רחוב עירוני, ציוץ-ציפורים בפארק, ואפילו דיאלוג בין דמויות', לפי גוגל. בשונה מ-Sora, שיצאה כאפליקציה עצמאית, Veo משולב מלכתחילה במארג-המוצרים הרחב של גוגל — Gemini, Flow ו-Vertex AI — מה שהעניק לו יציבות מסחרית ש-Sora נעדרה.
Runway ו-Kling: עקביות-דמות מול עלייה סינית
Runway המשיכה לפתח את קו ה-Gen שלה: Gen-4, שיצא ב-31 במרץ 2025, פתר לטענת החברה 'בעיית עקביות-הדמות שהגדירה את המגבלה המרכזית של יצירת-וידאו-AI' — יכולת לשמור על אותה דמות, עצם ומיקום לאורך כמה סצנות מתמונת-ייחוס בודדת. Kling, מצידה, המשיכה לצמוח מהר יותר: קלינג 2.0 (אפריל 2025), 2.1 (מאי 2025), ו-3.0 (פברואר 2026) עם תמיכה מובנית ב-4K. עד אמצע 2026 החלו מודלים סינים נוספים — Seedance של ByteDance ו-Wan של עליבאבא — לתפוס את החלק העליון של טבלאות-דירוג עצמאיות.
מירוץ שנמדד בהצבעות-עיוורות, לא רק בהכרזות
בשונה ממודלי-שפה, שיש להם מבחני-הנמקה מוסכמים, יצירת-וידאו נמדדת בעיקר דרך זירות של הצבעות-עיוורות בין משתמשים — למשל Video Arena של Artificial Analysis, שמציג לצופה שני קליפים בלי לחשוף מי המודל יצר כל אחד. הדירוג בזירה הזו מתחלף בקצב כזה שכל צילום-מצב מתיישן תוך שבועות: נכון לספטמבר 2026 מובילים אותה Gemini Omni Flash של גוגל, Wan 3.0 של עליבאבא ו-Minimax H3 Max, כשגם Seedance של ByteDance וגם Kling של Kuaishou נמצאים מתחתיהם ו-Runway Gen-4.5 מחוץ לרשימת-המובילים. המכנה-המשותף היציב לאורך 2026 אינו זהות המוביל אלא הנוכחות הסינית הכבדה בראש הטבלה. הדירוג משתנה שוב ושוב תוך חודשים ספורים — Sora עצמה, שפתחה את התחום פומבית ב-2024, כבר לא נמצאת בו בכלל אחרי שהופסקה — מה שממחיש למה זה נכתב כאן כתחרות מתמשכת, לא כדירוג קבוע.