מירוץ יצירת-הווידאו בבינה מלאכותית (AI Video Generation Race)

מגמות ועדכונים

הגדרה

תחרות תיעודית, שהואצה במיוחד מאז 2024, בין OpenAI (Sora), גוגל (Veo), Runway, Kuaishou הסינית (Kling) ועוד, לפרוץ את המגבלות של יצירת-וידאו מבוססת-AI — עקביות, אורך, שילוב-שמע ואיכות פיזיקלית — כשההובלה בטבלאות-הדירוג העצמאיות מתחלפת בין השחקנים שוב ושוב תוך חודשים.

למה וידאו פיגר מאחורי תמונה וטקסט

יצירת-וידאו מבוססת-AI נחשבה עד לפני זמן קצר יחסית מפגרת משמעותית אחרי יצירת-תמונה וטקסט, מסיבה הנדסית פשוטה: מודל-תמונה צריך לייצר פריים אחד עקבי, ומודל-וידאו צריך לשמור על עקביות — אותה דמות, אותו רקע, אותה תאורה — לאורך מאות פריימים ברצף, תוך שמירה על תנועה שמתנהגת כמו פיזיקה אמיתית. הפער הזה נסגר במהירות יוצאת-דופן החל מ-2024, כשכמה חברות שונות פרסמו, בטווח של חודשים ספורים זו מזו, מודלים שמתיימרים לפתור בדיוק את הבעיה הזו — כל אחת בדרכה.

2024: הזינוק — Runway, Luma, Kling ו-Meta

Dream Machine של Luma Labs יצא ב-12 ביוני 2024, וחמישה ימים אחר-כך, ב-17 ביוני, פרסמה Runway את Gen-3 Alpha. בין לבין, ב-10 ביוני 2024, חשפה הענקית הסינית Kuaishou את Kling — מודל שיודע ליצור עד שתי דקות וידאו ברזולוציית 1080p ובקצב 30 פריימים-לשנייה, זמין תחילה לבדיקה בתוך אפליקציית-העריכה KuaiYing שלה. ב-4 באוקטובר 2024 הצטרפה גם מטא עם Movie Gen — מודל שמייצר עד 16 שניות וידאו ב-16 פריימים-לשנייה, עם שמע-סביבתי מסונכרן שיכול להימשך עד 45 שניות — אך בשונה מהשאר הציגה אותו מטא כמחקר בלבד, בדרך ל'שחרור עתידי אפשרי', ולא פתחה אותו לציבור הרחב.

Sora של OpenAI: הפריצה, ואז ההיפוך

OpenAI חשפה את Sora ב-15 בפברואר 2024 (ראו הערך הייעודי לו לפרטים המלאים על הארכיטקטורה וההיסטוריה). הגרסה הציבורית הראשונה יצאה רק בדצמבר אותה שנה, ול-Sora 2, אפליקציה חברתית עצמאית, הצטרפה בספטמבר 2025 — אבל השימוש בה צנח, ולפי תחקיר של Wall Street Journal עלות-ההרצה עמדה על כמיליון דולר ליום, ובמרץ 2026 הודיעה OpenAI על סגירתה. Sora הפסיקה לפעול בפועל ב-26 באפריל 2026, וה-API שלה מתוכנן להיסגר ב-24 בספטמבר 2026. הסגירה הזו היא חלק בלתי-נפרד מהמרוץ: היא ממחישה שאפילו השחקן שפתח את התחום פומבית יכול לצאת ממנו תוך שנתיים בלבד.

Veo של גוגל: שילוב-שמע ואינטגרציה במארג-המוצרים

גוגל דיפמיינד הציגה את Veo במאי 2024, ופיתחה אותו במהירות: Veo 2 (דצמבר 2024) הוסיף תמיכה ב-4K, ו-Veo 3, שהושק ב-20 במאי 2025 בכנס Google I/O, היה החידוש המשמעותי ביותר — לראשונה במשפחת Veo, ולמעשה המודל המסחרי הרחב הראשון שמייצר גם פסקול מסונכרן הכולל דיבור: 'רעשי-תנועה ברקע של רחוב עירוני, ציוץ-ציפורים בפארק, ואפילו דיאלוג בין דמויות', לפי גוגל. בשונה מ-Sora, שיצאה כאפליקציה עצמאית, Veo משולב מלכתחילה במארג-המוצרים הרחב של גוגל — Gemini, Flow ו-Vertex AI — מה שהעניק לו יציבות מסחרית ש-Sora נעדרה.

Runway ו-Kling: עקביות-דמות מול עלייה סינית

Runway המשיכה לפתח את קו ה-Gen שלה: Gen-4, שיצא ב-31 במרץ 2025, פתר לטענת החברה 'בעיית עקביות-הדמות שהגדירה את המגבלה המרכזית של יצירת-וידאו-AI' — יכולת לשמור על אותה דמות, עצם ומיקום לאורך כמה סצנות מתמונת-ייחוס בודדת. Kling, מצידה, המשיכה לצמוח מהר יותר: קלינג 2.0 (אפריל 2025), 2.1 (מאי 2025), ו-3.0 (פברואר 2026) עם תמיכה מובנית ב-4K. עד אמצע 2026 החלו מודלים סינים נוספים — Seedance של ByteDance ו-Wan של עליבאבא — לתפוס את החלק העליון של טבלאות-דירוג עצמאיות.

מירוץ שנמדד בהצבעות-עיוורות, לא רק בהכרזות

בשונה ממודלי-שפה, שיש להם מבחני-הנמקה מוסכמים, יצירת-וידאו נמדדת בעיקר דרך זירות של הצבעות-עיוורות בין משתמשים — למשל Video Arena של Artificial Analysis, שמציג לצופה שני קליפים בלי לחשוף מי המודל יצר כל אחד. הדירוג בזירה הזו מתחלף בקצב כזה שכל צילום-מצב מתיישן תוך שבועות: נכון לספטמבר 2026 מובילים אותה Gemini Omni Flash של גוגל, Wan 3.0 של עליבאבא ו-Minimax H3 Max, כשגם Seedance של ByteDance וגם Kling של Kuaishou נמצאים מתחתיהם ו-Runway Gen-4.5 מחוץ לרשימת-המובילים. המכנה-המשותף היציב לאורך 2026 אינו זהות המוביל אלא הנוכחות הסינית הכבדה בראש הטבלה. הדירוג משתנה שוב ושוב תוך חודשים ספורים — Sora עצמה, שפתחה את התחום פומבית ב-2024, כבר לא נמצאת בו בכלל אחרי שהופסקה — מה שממחיש למה זה נכתב כאן כתחרות מתמשכת, לא כדירוג קבוע.

ארבעה שחקנים במירוץ יצירת-הווידאו
Sora (OpenAI)Veo (Google DeepMind)Kling (Kuaishou)Runway (Gen-4)
השקה ראשונהפברואר 2024מאי 2024יוני 2024יוני 2024 (Gen-3 Alpha)
יכולת-מפתחדיפוזיה-טרנספורמר, עד דקהשילוב-שמע מסונכרן (מ-Veo 3, מאי 2025)עד 2 דקות, 1080p, 30fpsעקביות-דמות בין סצנות (Gen-4, מרץ 2025)
אינטגרציהאפליקציה עצמאית (הופסקה)Gemini, Flow, Vertex AIאפליקציית KuaiYing / אתר עצמאיפלטפורמה עצמאית לאנשי-מקצוע
מצב נכון לספטמבר 2026הופסק — API נסגר 24.9.2026פעיל, Veo 3.1פעיל, מוביל בדירוגי-הצבעות (Kling 3.0)פעיל, Gen-4.5, מחוץ לעשירייה-המובילה בזירה

שאלות נפוצות ❓

למה יצירת-וידאו פיגרה כל-כך הרבה אחרי יצירת-תמונה וטקסט?

כי מודל-וידאו צריך לשמור על עקביות — אותה דמות, רקע ותאורה — לאורך מאות פריימים תוך שמירה על תנועה פיזיקלית-סבירה, לא רק פריים בודד עקבי כמו במודל-תמונה. זהו אתגר הנדסי נפרד ומורכב יותר, וזו הסיבה שהקפיצה האמיתית בתחום התרחשה רק החל מ-2024.

מי היה הראשון להציג מודל יצירת-וידאו-מטקסט מתקדם ב-2024?

כמה חברות פרסמו כמעט בו-זמנית ביוני 2024: Kuaishou הסינית (Kling, 10 ביוני), Luma Labs (Dream Machine, 13 ביוני) ו-Runway (Gen-3 Alpha, 17 ביוני). OpenAI חשפה את Sora כבר בפברואר 2024, אבל הפכה אותו לזמין לציבור רק בדצמבר אותה שנה.

למה OpenAI סגרה את Sora, בזמן שגוגל ממשיכה להריץ את Veo?

לפי תחקיר Wall Street Journal שסוקר בהרחבה, עלות-ההרצה של Sora עמדה על כמיליון דולר ליום מול הכנסות נמוכות ומשתמשים שצנחו. Veo, לעומת זאת, משולב מלכתחילה במארג-המוצרים הרחב של גוגל (Gemini, Flow, Vertex AI) ולא תלוי בהכנסות-עצמאיות מאפליקציה נפרדת — הבדל מבני שמסביר חלק מהשוני בהישרדות.

האם השחקנים המערביים (OpenAI, גוגל, Runway) עדיין מובילים את התחום?

לא בהכרח. בטבלת Artificial Analysis Video Arena מודלים סיניים — Wan של עליבאבא, Seedance של ByteDance ו-Kling של Kuaishou — מחזיקים נוכחות כבדה בראש הטבלה לאורך 2026, לצד מודלים של גוגל; Runway Gen-4.5 נמצאת מחוץ לרשימת-המובילים. הדירוג עצמו מתחלף כל כמה שבועות, ולכן כדאי לבדוק אותו ישירות ולא להסתמך על צילום-מצב.

האם יש היום דרך אובייקטיבית להשוות בין מודלי-וידאו שונים?

הכלי הנפוץ ביותר הוא זירות של הצבעות-עיוורות כמו Video Arena של Artificial Analysis, שבהן משתמשים מדרגים זוגות-קליפים בלי לדעת איזה מודל יצר כל אחד — אבל גם הדירוג הזה משתנה שוב ושוב תוך חודשים ככל שיוצאים מודלים חדשים.