מירוץ מודלי-העולם (World Model Race)

מגמות ועדכונים

הגדרה

תחרות תיעודית בין כמה מעבדות-AI מובילות — גוגל דיפמיינד, NVIDIA, World Labs של פיי-פיי לי ואחרות — לבנות 'מודלי-עולם': מערכות שלומדות לדמות איך העולם הפיזי או החזותי מתנהג ולחזות כיצד הוא ישתנה בתגובה לפעולה, לא רק ליצור פלט חד-פעמי.

מה זה בכלל 'מודל-עולם'?

המונח 'מודל-עולם' (World Model) עתיק יחסית בתחום — יורגן שמידהובר הציע גרסה מוקדמת שלו כבר ב-1990, ודייוויד הא ושמידהובר החיו את הרעיון במאמר משפיע ב-2018, שבו למדו סוכנים לנהוג ברכבים וירטואליים ולשחק משחקי-מחשב בתוך סימולציות שהמודל עצמו יצר. ההגדרה הטכנית: מודל-עולם הוא מערכת-למידת-מכונה שבונה ייצוג פנימי של סביבה וחוזה איך הסביבה הזו תשתנה בתגובה לפעולות — בניגוד למודל-שפה גדול, שחוזה את הטוקן הבא בטקסט בלי הבנה מובנית של פיזיקה, מודל-עולם מעבד קלט חושי (בדרך-כלל פיקסלים) ומנבא שינויי-מצב במרחב סמוי, מה שמאפשר תכנון והיסק סיבתי ולא רק ייצור-פלט סביר סטטיסטית. גוגל דיפמיינד מנסחת זאת כמערכות ש'משתמשות בהבנתן את העולם כדי לדמות היבטים ממנו, ומאפשרות לסוכנים לחזות איך סביבה תתפתח וכיצד פעולותיהם ישפיעו עליה'.

גוגל דיפמיינד: מסדרת Genie למודל-עולם בזמן-אמת

גוגל דיפמיינד הציגה את Genie הראשון כמודל שיוצר סביבות-2D אינטראקטיביות מתמונה או טקסט בודדים. Genie 2, ב-2024, קפץ לסביבות תלת-מימד מפורטות ושמר על עקביות-עולם עד כדקה, אף שרוב הדוגמאות שהוצגו נמשכו 10 עד 20 שניות. הקפיצה המשמעותית הבאה הייתה Genie 3, שדיפמיינד פרסמה ב-5 באוגוסט 2025 כ'מודל-העולם הראשון שלה שמאפשר אינטראקציה בזמן-אמת' — יצירת סביבות תלת-מימד באיכות 720p ובקצב 24 פריימים-לשנייה, לאורך כמה דקות, עם 'זיכרון חזותי' שמאפשר לסביבה להישאר עקבית גם כשהמשתמש חוזר למקום שראה לפני כדקה. דיפמיינד עצמה מתארת מודלי-עולם כ'אבן-דרך מרכזית בדרך ל-AGI', מפני שהם מאפשרים לאמן סוכני-AI ב'תוכנית-לימודים בלתי-מוגבלת של סביבות-סימולציה עשירות' — נימוק שממסגר את המרוץ הזה כתחרות על תשתית-האימון של דור-הסוכנים הבא, לא רק על כלי-יצירה.

NVIDIA Cosmos: מודלי-עולם עבור רובוטים ורכבים אוטונומיים

NVIDIA הכריזה על Cosmos ב-6 בינואר 2025, בכנס CES — פלטפורמה של מודלי-עולם-יסוד (World Foundation Models), טוקנייזרים חזותיים ותשתית לעיבוד-נתונים מואץ, שמטרתה המוצהרת שונה מזו של Genie: לא יצירת-תוכן, אלא ייצור נתונים סינתטיים פוטו-ריאליסטיים ומבוססי-פיזיקה לאימון והערכה של רובוטים ורכבים-אוטונומיים, בלי הצורך באיסוף עתיר-עלות של נתונים אמיתיים. ג'נסן הואנג, מנכ״ל NVIDIA, ניסח את המניע התחרותי במפורש: 'רגע ה-ChatGPT של הרובוטיקה מגיע. בדיוק כמו מודלי-שפה גדולים, מודלי-עולם-יסוד הם הבסיס להתקדמות בפיתוח רובוטים ורכבים-אוטונומיים... יצרנו את Cosmos כדי לדמוקרטיזציה של AI פיזי'. Cosmos כבר אומץ על-ידי חברות כמו Uber, XPENG ו-Waabi.

World Labs של פיי-פיי לי: Marble כמוצר מסחרי ראשון

World Labs, שיצאה מ'מצב-סמוי' בספטמבר 2024 עם 230 מיליון דולר בגיוס-הון, השיקה ב-12 בנובמבר 2025 את Marble — המוצר המסחרי הראשון שלה, שהופך הנחיות-טקסט, תמונות, וידאו, פריסות תלת-מימד או פאנורמות לסביבות-תלת-מימד ניתנות-לעריכה ולהורדה, תואמות ל-Vision Pro ול-Quest 3. ההשקה, לפי TechCrunch, הציבה את החברה 'לפני מתחרות בבניית מודלי-עולם' כמו Decart, Odyssey וה-Genie של גוגל עצמה. ג'סטין ג'ונסון, מייסד-שותף של החברה, ניסח את הנימוק המדעי מאחורי המרוץ הזה, לפי סיכום של TechCrunch: בשונה מיצירת-תמונה ווידאו, לרובוטיקה אין מאגר-נתוני-אימון גדול — אבל עם מחוללים כמו Marble קל יותר לדמות סביבות-אימון. זה אותו נימוק בדיוק ש-NVIDIA השתמשה בו עבור Cosmos, מכיוון שונה לגמרי.

החיבור ליצירת-וידאו: מודל-עולם כמושג חופף, לא זהה

הגבול בין 'מודל-עולם' ל'מודל יצירת-וידאו' מטושטש בכוונה אצל חלק מהחברות: OpenAI עצמה מיסגרה את Sora, מודל יצירת-הווידאו שלה, לא רק ככלי-יצירה אלא כניסיון לבנות 'סימולטור-של-עולם' (ראו הערך הייעודי ל-Sora לפרטים). גם Runway, בהכרזות-המימון שלה, השתמשה בניסוח דומה — 'בניית סימולטורים-של-עולם חדשים'. אבל לא כל מודלי-העולם מבוססים על אותה טכניקה: Genie ו-Marble יוצרים סביבות אינטראקטיביות שאפשר לנווט בהן בזמן-אמת, ו-Cosmos מיועד לאימון-רובוטים ולא לצפייה אנושית — כך שהמונח מכסה כמה גישות טכניות-שונות שמתחרות על אותה מטרה סופית: מערכת שמבינה איך העולם עובד, לא רק איך הוא נראה.

למה זו תחרות, ומה מסתכן בה

מה שהופך את זה למרוץ תיעודי ולא לפיתוח-פנימי בודד הוא שכל השחקנים — גוגל דיפמיינד, NVIDIA, World Labs וחברות-נוספות כמו Decart ו-Odyssey — פרסמו מוצרים או מחקר תחרותיים בתוך פחות משנתיים, 2024–2025, וכל אחד מהם מנמק את המהלך בטענה כמעט זהה: מודלי-שפה למדו לכתוב, אבל לא למדו פיזיקה, ומי שיבנה ראשון את השכבה הזו יחזיק את תשתית-האימון של דור-הרובוטים והסוכנים הבא. עם זאת, כל המודלים הקיימים כיום עדיין מוגבלים לדקות בודדות של עקביות, ומרבית ההכרזות (Genie 3, Marble) יצאו כ'תצוגה-מוקדמת למחקר' עם גישה מוגבלת, לא כמוצר-צריכה רחב — כך שמדובר בתחרות על כיוון-הפיתוח הבא, לא בטכנולוגיה בשלה כבר היום.

שלושה מודלי-עולם, שלוש מטרות שונות
Genie 3 (Google DeepMind)Cosmos (NVIDIA)Marble (World Labs)
מטרה עיקריתסביבות-משחק אינטראקטיביות בזמן-אמתנתוני-אימון סינתטיים לרובוטים ורכבים-אוטונומייםהמרת תמונה/וידאו לסביבת-תלת-מימד ניתנת-לעריכה
תאריך השקה5.8.2025 (תצוגה-מוקדמת-מחקר)6.1.202512.11.2025 (מוצר מסחרי)
קהל-יעדחוקרים ויוצרים נבחריםמפתחי רובוטיקה ורכב-אוטונומייוצרים, כולל תמיכה ב-VR

שאלות נפוצות ❓

מה זה מודל-עולם, ובמה הוא שונה ממודל-שפה גדול?

מודל-עולם הוא מערכת שבונה ייצוג פנימי של סביבה ולומדת לחזות איך היא תשתנה בתגובה לפעולה — למשל מה יקרה אם דמות תקפוץ או תזיז חפץ. בניגוד למודל-שפה, שחוזה את המילה הבאה בטקסט בלי הבנה מובנית של פיזיקה, מודל-עולם מעבד קלט חושי (בעיקר פיקסלים) ומנבא שינויי-מצב, מה שמאפשר תכנון והיסק סיבתי.

מי מוביל כרגע את מירוץ מודלי-העולם?

אין מוביל יחיד מוסכם — כל שחקן מתמקד בזווית שונה: גוגל דיפמיינד (Genie 3) בסביבות אינטראקטיביות בזמן-אמת, NVIDIA (Cosmos) בנתונים סינתטיים לאימון-רובוטים ורכבים-אוטונומיים, ו-World Labs (Marble) בהמרת תמונות לסביבות-תלת-מימד ניתנות-לעריכה. כל השלושה פרסמו מוצרים או תצוגות-מוקדמות בטווח 2024–2025.

האם Sora של OpenAI נחשב 'מודל-עולם'?

OpenAI עצמה מיסגרה אותו ככזה, לא רק ככלי-יצירת-וידאו (ראו הערך הייעודי ל-Sora לפרטים). אבל בפועל Sora מייצר קליפ ליניארי, לא סביבה שאפשר לנווט בה אינטראקטיבית בזמן-אמת כמו Genie — כך שהוא נמצא בתחום-החפיפה בין 'מודל-וידאו' ל'מודל-עולם', לא בהכרח בשני הצדדים באותה מידה.

למה חברות-רובוטיקה ורכב-אוטונומי מתעניינות דווקא במודלי-עולם?

לפי ג'נסן הואנג, מנכ״ל NVIDIA, לרובוטיקה אין מאגר-נתונים-אמיתיים עצום כמו שיש לטקסט או לתמונות — ומודל-עולם שיודע לדמות פיזיקה בצורה אמינה מאפשר לייצר נתוני-אימון סינתטיים בכמות בלתי-מוגבלת, בלי איסוף יקר של נתונים אמיתיים מהעולם.

כמה בשלה הטכנולוגיה הזו כיום?

עדיין בשלבים מוקדמים: רוב המודלים הקיימים (Genie 3, Marble) שומרים על עקביות-סביבה לדקות בודדות בלבד, ורובם יצאו כתצוגה-מוקדמת-למחקר עם גישה מוגבלת ולא כמוצר-צריכה רחב.