מודל-עולם (World Model)
הגדרה
מודל-עולם הוא ייצוג פנימי שמערכת בינה מלאכותית בונה לעצמה של הסביבה שבה היא פועלת, כדי לחזות איך הסביבה תשתנה בתגובה לפעולות שלה — ולתכנן לפני שהיא פועלת בפועל.
💡 דוגמה
נהג שרואה כדור מתגלגל לכביש מאט עוד לפני שמישהו רץ אחריו — הוא "מריץ בראש" מה עלול לקרות.
מודל-עולם נותן למכונה יכולת דומה: לנסות פעולה בדמיון לפני שמבצעים אותה במציאות.
הרעיון: סימולציה בתוך הראש של המכונה
מודל-עולם (World Model) הוא מערכת למידת-מכונה שבונה ייצוג פנימי של סביבה ולומדת לחזות איך הסביבה הזו משתנה לאורך זמן בתגובה לפעולות. במילים פשוטות: במקום רק להגיב למה שהיא רואה עכשיו, המערכת מחזיקה "עותק מוקטן" של העולם ויכולה לשאול את עצמה "מה יקרה אם...". גוגל דיפמיינד מנסחת זאת כמערכות AI ש"משתמשות בהבנתן את העולם כדי לדמות היבטים שלו", וכך מאפשרות לסוכן לחזות גם איך הסביבה תתפתח וגם איך הפעולות שלו ישפיעו עליה.
מטא פירטה ב-2025 שלוש יכולות שמודל-עולם טוב צריך לספק: להבין את מה שהוא רואה, כמו לזהות חפצים, פעולות ותנועות בסרטון; לחזות איך העולם יתפתח ואיך הוא ישתנה אם הסוכן יעשה משהו; ולשמש לתכנון של רצף פעולות שמוביל למטרה. זה ההבדל המהותי בין מודל-עולם לבין מערכת שרק מזהה תבניות: היכולת לבחון אפשרויות בדמיון לפני שמבצעים אותן.
השורשים: מודל קטן של המציאות
הרעיון ותיק בהרבה מהבינה המלאכותית. קנת' קרייק הציע בספרו "The Nature of Explanation" משנת 1943 שהמוח בונה "מודלים בקנה מידה קטן" של המציאות ומשתמש בהם כדי לצפות אירועים מראש — ומקובל לייחס לו את מקור המונח "מודל מנטלי". ג'יי רייט פורסטר, אבי תחום הדינמיקה של מערכות, ניסח זאת כך: "התמונה של העולם סביבנו, שאנחנו נושאים בראש, היא רק מודל. איש אינו מדמיין בראשו את כל העולם".
בלמידת מכונה, יורגן שמידהובר הכניס את המונח "מודל-עולם" לשימוש ב-1990, כשהשתמש ברשתות נוירונים חוזרות כדי לחזות מצבים עתידיים של סביבה. מאז הרעיון חוזר שוב ושוב בתחום, בכל פעם עם כלים חזקים יותר.
ללמוד בתוך חלום
המאמר שהחזיר את המושג למרכז הבמה פורסם ב-27 במרץ 2018 בידי דייוויד הא מ-Google Brain ושמידהובר, תחת הכותרת הפשוטה "World Models". הסוכן שלהם היה בנוי משלושה חלקים: רכיב "ראייה" שדוחס כל תמונה מהמשחק לתיאור קצר, רכיב "זיכרון" שחוזה מה יבוא אחר כך על סמך מה שקרה ומה שהסוכן עשה, ורכיב "שליטה" קטן שבוחר את הפעולה. במשחק מירוץ מכוניות וירטואלי הגיע הסוכן לציון 906, משימה שלפי החוקרים שיטות קודמות לא פתרו. בניסוי נוסף, במשחק היריות VizDoom, הסוכן התאמן כולו בתוך סביבה ש"הוזתה" על ידי מודל-העולם שלו — ואז הצליח גם במשחק האמיתי.
הגישה הזו התפתחה בהמשך לסדרת אלגוריתמים בשם Dreamer. לפי מאמר DreamerV3, שפורסם לראשונה בינואר 2023, האלגוריתם "לומד מודל של הסביבה ומשפר את התנהגותו באמצעות דמיון של תרחישים עתידיים", והיה הראשון שהצליח לאסוף יהלומים במשחק מיינקראפט מאפס, בלי נתונים אנושיים ובלי תוכנית לימוד מוכנה מראש. זה הקשר בין מודלי-עולם לבין למידת חיזוק: הסוכן מתאמן הרבה בדמיון, ומעט יחסית בעולם האמיתי.
האם למודלי-שפה יש מודל-עולם?
אחת השאלות הסוערות בתחום היא אם מודל-שפה גדול, שאומן רק לחזות טקסט, בונה בדרך אגב ייצוג של העולם. מחקר מאוקטובר 2022, שהוצג בכנס ICLR 2023, אימן גרסה של מודל GPT לחזות מהלכים חוקיים במשחק הלוח אותלו, מתוך רצפים של מהלכים בלבד. החוקרים מצאו "ייצוג פנימי מתהווה" של מצב הלוח, והראו שאם משנים את הייצוג הזה מבפנים, משתנות גם תחזיות המודל. מבחינת רבים זו הייתה עדות לכך שמודל יכול לבנות לעצמו מודל-עולם רק מצפייה ברצפים.
מחקר מ-2024 של קיון ופה (Keyon Vafa) ועמיתיו הציג תמונה זהירה יותר. הם בחנו מודלים בתחומים כמו משחקים, חידות היגיון וניווט, ומצאו שהמודלים "מצליחים היטב באבחונים הקיימים" למודל-עולם, אבל שמודלי-העולם שלהם "קוהרנטיים הרבה פחות ממה שהם נראים" — וכשהמשימה משתנה מעט, הביצועים מתדרדרים. הוויכוח עדיין פתוח, והוא חלק מהשאלה הרחבה יותר אם מודלי-שפה "מבינים" את מה שהם כותבים.
לה-קון: מודל-עולם כחלופה למודלי-שפה
הקול הבולט ביותר בעד מודלי-עולם הוא יאן לה-קון. במאמר עמדה מ-2022, "A Path Towards Autonomous Machine Intelligence", טען שבינה דורשת מודלים שחוזים את העולם ולא רק זיהוי תבניות, והציע ארכיטקטורה בשם JEPA. במטא, הארכיטקטורה הזו הובילה ל-V-JEPA 2, שהוצג ב-11 ביוני 2025: מקודד הופך וידאו לייצוג מתמטי של מצב העולם, ורכיב חיזוי מנבא את הייצוג הבא — כלומר החיזוי נעשה על התיאור המופשט ולא על התמונה עצמה. לפי מטא, המודל אומן על יותר ממיליון שעות וידאו ומיליון תמונות, ואחר כך על 62 שעות בלבד של נתוני רובוטים, והגיע ל-65% עד 80% הצלחה בהרמה והנחה של חפצים חדשים בסביבות שלא ראה קודם.
החברה שייסד לה-קון, AMI Labs, גייסה ב-9 במרץ 2026 סכום של 1.03 מיליארד דולר לפי שווי של 3.5 מיליארד דולר לפני ההשקעה, כדי לבנות מודלי-עולם על בסיס JEPA. אפילו מנכ"ל החברה, אלכסנדר לברן, הזהיר מהבאז: "התחזית שלי היא ש'מודלי-עולם' יהיו מילת הבאז הבאה. בתוך שישה חודשים כל חברה תקרא לעצמה מודל-עולם כדי לגייס כסף".
מהמעבדה לעולם: למה זה חשוב
בין השימושים המרכזיים של מודלי-עולם: אימון רובוטים, רכבים אוטונומיים ובידור אינטראקטיבי. ההיגיון זהה בכולם: אם מערכת יכולה לדמות את העולם באופן אמין, אפשר לאמן אותה בסימולציה במקום לאסוף נתונים יקרים מהמציאות. גוגל דיפמיינד כותבת שמודלי-עולם הם "אבן דרך מרכזית בדרך ל-AGI", מפני שהם מאפשרים לאמן סוכנים ב"תוכנית לימודים בלתי מוגבלת של סביבות סימולציה עשירות".
הדוגמה המוכרת היא Genie 3 של דיפמיינד מאוגוסט 2025, שמייצר עולמות אינטראקטיביים ברזולוציה 720p ובקצב 24 פריימים לשנייה, ושומר על עקביות לאורך כמה דקות. דיפמיינד עצמה מונה את המגבלות: מרחב פעולות מצומצם לסוכן, קושי באינטראקציה בין כמה סוכנים, חוסר דיוק בשחזור מקומות אמיתיים, ועולמות שמחזיקים דקות ולא שעות — ולכן הוא שוחרר כתצוגה מוקדמת מוגבלת לחוקרים ויוצרים. התחרות המסחרית בין דיפמיינד, NVIDIA, World Labs ואחרות מתוארת בערך מירוץ מודלי-העולם; כאן העיקר הוא המושג: מכונה שלא רק מגיבה לעולם, אלא מחזיקה בתוכה תמונה שלו.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| Dreamer (למידת חיזוק) | V-JEPA 2 (חיזוי ייצוג) | Genie 3 (עולם מחולל) | |
|---|---|---|---|
| מה המודל חוזה | תרחישים עתידיים בתוך מודל נלמד של הסביבה | את הייצוג המופשט של הרגע הבא, לא פיקסלים | את התמונה הבאה של עולם אינטראקטיבי, בזמן אמת |
| למה הוא משמש | לשפר את ההתנהגות של סוכן באמצעות דמיון | הבנה, חיזוי ותכנון, כולל תכנון פעולות לרובוט | יצירת סביבות לחקירה ולאימון סוכנים |
| הישג מתועד | איסוף יהלומים במיינקראפט בלי נתונים אנושיים | 65%–80% הצלחה בהרמה והנחה של חפצים חדשים | 720p ו-24 פריימים לשנייה, עקביות לכמה דקות |
שאלות נפוצות ❓
במה מודל-עולם שונה ממודל-שפה כמו ChatGPT?
מודל-שפה אומן לחזות טקסט. מודל-עולם נבנה כדי לחזות איך סביבה משתנה בתגובה לפעולות, ולרוב מקבל קלט כמו וידאו או חיישנים. השאלה אם מודלי-שפה בונים בכל זאת מודל-עולם פנימי עדיין שנויה במחלוקת.
מי המציא את המושג?
את הרעיון הכללי של מודל קטן של המציאות בתוך המוח מייחסים לקנת' קרייק ב-1943. בלמידת מכונה, יורגן שמידהובר הכניס את המונח לשימוש ב-1990, ודייוויד הא ושמידהובר החיו אותו במאמר מ-2018.
מה פירוש "לאמן סוכן בתוך חלום"?
הסוכן מתאמן בתוך סימולציה שמודל-העולם שלו עצמו מייצר, במקום בעולם האמיתי. בניסוי של הא ושמידהובר, סוכן שהתאמן כך במשחק VizDoom הצליח אחר כך גם במשחק האמיתי.
למה זה חשוב לרובוטים?
כי איסוף נתונים מרובוטים אמיתיים יקר ואיטי. מודל-עולם אמין מאפשר לאמן ולבדוק בסימולציה. V-JEPA 2 של מטא, למשל, אומן בעיקר על וידאו ונזקק ל-62 שעות בלבד של נתוני רובוטים.