Vision-Language-Action Model (VLA) — מודל-רובוטיקה שכותב פקודת-תנועה כמחרוזת-מספרים

רובוטיקה

הגדרה

Vision-Language-Action Model, מודל ראייה-שפה-פעולה, הוא מודל שאומן גם על נתוני אינטרנט וגם על נתוני רובוטים ומתרגם הבנה חזותית-לשונית ישירות לפקודות תנועה לרובוט.

מה זה, ומה בא במקומו

Vision-Language-Action Model (VLA) הוא מודל שאומן גם על נתוני אינטרנט וגם על נתוני רובוטים, ומתרגם הבנה חזותית-לשונית ישירות לפקודות תנועה לרובוט. את שם הקטגוריה טבע מאמר RT-2 מיולי 2023, שכתב במפורש שהוא מכנה משפחת מודלים כזאת מודלי ראייה-שפה-פעולה. מודל כזה בא במקום תכנות או אימון ייעודיים לכל משימה בנפרד: כאן מודל אחד אמור להתמודד גם עם הוראה שלא הופיעה כלל בנתוני האימון של הרובוט.

התעלול הטכני: פעולה שנכתבת כמו טקסט

הקושי המרכזי הוא שמודל ראייה-שפה יודע לפלוט טקסט, ורובוט זקוק לפקודת תנועה. הפתרון שהוצג ב-RT-2 פשוט להפליא: לתאר את הפעולה כמחרוזת של מספרים, ולהכניס אותה למערך האימון בדיוק כמו אסימוני-שפה רגילים. מחרוזת כזאת נפתחת בדגל שאומר אם להמשיך או לסיים את הפרק הנוכחי, וממשיכה בפקודות שמשנות את המיקום ואת הזווית של קצה-הזרוע, ואת מידת הפתיחה של התפסן.

הנתון המספרי — ומה בדיוק הוא משווה

בהודעת Google DeepMind נכתב ש-RT-2 שמר על הביצועים במשימות המקוריות שהופיעו בנתוני הרובוט, ושיפר את הביצועים בתרחישים שהרובוט לא ראה קודם, מ-32 אחוזים של RT-1 ל-62 אחוזים. כדאי לקרוא את המשפט הזה לאט. אלה שני מודלים שונים שנמדדו על אותו מבחן, ולא מדידה של מודל אחד לפני ואחרי; והמספרים מתייחסים לתרחישים הלא-מוכרים בלבד, לא לשיעור ההצלחה הכולל.

מה נצפה שלא היה קודם

ההערכה נשענה על יותר משישת אלפים ניסויים על רובוטים. מה שהתגלה בהם הוא יכולות שלא הופיעו בנתוני הרובוט: פירוש הוראות שלא היו שם, כמו הנחת חפץ על מספר או על סמל מסוים, והסקה בסיסית — להרים את החפץ הקטן ביותר, או את זה שקרוב ביותר לחפץ אחר. בשילוב שרשור מחשבה בחר המודל גם אבן כפטיש מאולתר, ומשקה אנרגיה לאדם עייף.

לא מעבדה אחת: π0 ו-OpenVLA

הגישה התפשטה מהר. מודל π0, שפרסמה חברת Physical Intelligence באוקטובר 2024, בנוי מעל מודל ראייה-שפה מאומן-מראש כדי לרשת ממנו ידע סמנטי בקנה-מידה אינטרנטי, ואומן על נתונים מזרוע אחת, משתי זרועות וממניפולטורים ניידים. המשימות שהודגמו בו כוללות קיפול כביסה, פינוי שולחן והרכבת קופסאות. באותה שנה יצא גם OpenVLA, מודל בקוד פתוח בן שבעה מיליארד פרמטרים שאומן על 970 אלף הדגמות רובוטיות מן העולם האמיתי. הערך π₀ עוקב אחר המודל של Physical Intelligence לעומקו — הארכיטקטורה, היקף האימון והמבחנים שבהם נמדד.

שלוש גישות לאותה שאלה, ומה עדיין פתוח

מאמר π0 עצמו פותח בהסתייגות: הבאת למידת-הרובוטים לרמת הכלליות הדרושה למערכות אמיתיות נתקלת במכשולים גדולים בנתונים, בהכללה ובעמידות. מפתחיו מכנים את המדיניות הכללית הזאת מודל יסוד לרובוטים. כדאי גם למקם את הגישה מול שכנותיה: Behavior Tree הוא מבנה שמתוכנן בדרך-כלל בידי מהנדס, והוא קובע איזו תת-משימה תרוץ עכשיו; למידת חיזוק לבקרת רובוטים לומדת מדיניות מניסוי וטעייה מול תגמול; וכאן הידע מגיע מן הרשת אל תוך הפקודה עצמה.

שאלות נפוצות ❓

מה ההבדל בין VLA לבין מודל שפה רגיל?

מודל שפה מקבל טקסט ומחזיר טקסט. VLA מקבל גם תמונה ממצלמת הרובוט, ומחזיר פקודת תנועה במקום משפט. הדרך שבה זה נעשה היא שהפעולה נכתבת כמחרוזת של מספרים ומאומנת בדיוק כמו אסימוני-שפה, כך שאותו מודל יכול לפלוט את שניהם.

מה בדיוק אומר הנתון של 32 ואחר-כך 62 אחוזים?

שבתרחישים שהרובוט לא ראה קודם, RT-1 הצליח ב-32 אחוזים מן המקרים ו-RT-2 ב-62 אחוזים. אלה שני מודלים שונים על אותו מבחן, ולא מדידה של מודל אחד לפני שיפור ואחריו; והמספר תקף לתרחישים הלא-מוכרים בלבד, לא לשיעור ההצלחה הכולל.

למה בכלל צריך נתוני אינטרנט כדי להזיז זרוע?

כי איסוף נתוני רובוט לכל חפץ, לכל סביבה ולכל משימה אינו מעשי. אימון על תמונות וטקסט מן הרשת מספק ידע שאין בנתוני הרובוט — למשל מה זה סמל מסוים, ואיזה משקה מתאים לאדם עייף — והמודל מצרף אותו לפקודת התנועה.

האם הגישה הזאת מחליפה את שיטות הבקרה האחרות?

לא, והמקורות אינם טוענים זאת. מבנה Behavior Tree מתוכנן בדרך-כלל בידי מהנדס וקובע איזו תת-משימה תרוץ ברגע נתון; למידת חיזוק לבקרת רובוטים לומדת מדיניות מניסוי וטעייה מול תגמול; והמודלים כאן מביאים ידע מן הרשת אל תוך הפקודה. אלה שלוש תשובות שונות לאותה שאלה.

מה עדיין לא פתור?

המאמר שהציג את π0 פותח בדיוק בזה: הבאת למידת-הרובוטים לרמת הכלליות שמערכות אמיתיות דורשות נתקלת במכשולים גדולים בנתונים, בהכללה ובעמידות. ההדגמות מרשימות, אבל הן עדיין הדגמות, וההכללה לסביבה חדשה לגמרי היא הבעיה הפתוחה.