מה זה, ומה בא במקומו
Vision-Language-Action Model (VLA) הוא מודל שאומן גם על נתוני אינטרנט וגם על נתוני רובוטים, ומתרגם הבנה חזותית-לשונית ישירות לפקודות תנועה לרובוט. את שם הקטגוריה טבע מאמר RT-2 מיולי 2023, שכתב במפורש שהוא מכנה משפחת מודלים כזאת מודלי ראייה-שפה-פעולה. מודל כזה בא במקום תכנות או אימון ייעודיים לכל משימה בנפרד: כאן מודל אחד אמור להתמודד גם עם הוראה שלא הופיעה כלל בנתוני האימון של הרובוט.
התעלול הטכני: פעולה שנכתבת כמו טקסט
הקושי המרכזי הוא שמודל ראייה-שפה יודע לפלוט טקסט, ורובוט זקוק לפקודת תנועה. הפתרון שהוצג ב-RT-2 פשוט להפליא: לתאר את הפעולה כמחרוזת של מספרים, ולהכניס אותה למערך האימון בדיוק כמו אסימוני-שפה רגילים. מחרוזת כזאת נפתחת בדגל שאומר אם להמשיך או לסיים את הפרק הנוכחי, וממשיכה בפקודות שמשנות את המיקום ואת הזווית של קצה-הזרוע, ואת מידת הפתיחה של התפסן.
הנתון המספרי — ומה בדיוק הוא משווה
בהודעת Google DeepMind נכתב ש-RT-2 שמר על הביצועים במשימות המקוריות שהופיעו בנתוני הרובוט, ושיפר את הביצועים בתרחישים שהרובוט לא ראה קודם, מ-32 אחוזים של RT-1 ל-62 אחוזים. כדאי לקרוא את המשפט הזה לאט. אלה שני מודלים שונים שנמדדו על אותו מבחן, ולא מדידה של מודל אחד לפני ואחרי; והמספרים מתייחסים לתרחישים הלא-מוכרים בלבד, לא לשיעור ההצלחה הכולל.
מה נצפה שלא היה קודם
ההערכה נשענה על יותר משישת אלפים ניסויים על רובוטים. מה שהתגלה בהם הוא יכולות שלא הופיעו בנתוני הרובוט: פירוש הוראות שלא היו שם, כמו הנחת חפץ על מספר או על סמל מסוים, והסקה בסיסית — להרים את החפץ הקטן ביותר, או את זה שקרוב ביותר לחפץ אחר. בשילוב שרשור מחשבה בחר המודל גם אבן כפטיש מאולתר, ומשקה אנרגיה לאדם עייף.
לא מעבדה אחת: π0 ו-OpenVLA
הגישה התפשטה מהר. מודל π0, שפרסמה חברת Physical Intelligence באוקטובר 2024, בנוי מעל מודל ראייה-שפה מאומן-מראש כדי לרשת ממנו ידע סמנטי בקנה-מידה אינטרנטי, ואומן על נתונים מזרוע אחת, משתי זרועות וממניפולטורים ניידים. המשימות שהודגמו בו כוללות קיפול כביסה, פינוי שולחן והרכבת קופסאות. באותה שנה יצא גם OpenVLA, מודל בקוד פתוח בן שבעה מיליארד פרמטרים שאומן על 970 אלף הדגמות רובוטיות מן העולם האמיתי. הערך π₀ עוקב אחר המודל של Physical Intelligence לעומקו — הארכיטקטורה, היקף האימון והמבחנים שבהם נמדד.
שלוש גישות לאותה שאלה, ומה עדיין פתוח
מאמר π0 עצמו פותח בהסתייגות: הבאת למידת-הרובוטים לרמת הכלליות הדרושה למערכות אמיתיות נתקלת במכשולים גדולים בנתונים, בהכללה ובעמידות. מפתחיו מכנים את המדיניות הכללית הזאת מודל יסוד לרובוטים. כדאי גם למקם את הגישה מול שכנותיה: Behavior Tree הוא מבנה שמתוכנן בדרך-כלל בידי מהנדס, והוא קובע איזו תת-משימה תרוץ עכשיו; למידת חיזוק לבקרת רובוטים לומדת מדיניות מניסוי וטעייה מול תגמול; וכאן הידע מגיע מן הרשת אל תוך הפקודה עצמה.