הרעיון: משפט שאינו רק מילים
מודלי שפה גדולים כמו PaLM מצטיינים במשימות מורכבות, אבל כשמבקשים מהם לפעול בעולם האמיתי צצה בעיית העיגון: המילים אינן מחוברות לשום דבר שהמערכת רואה או חשה. PaLM-E מציע לפתור זאת בקלט עצמו. במקום לתאר את הסצנה במילים ולהזין את התיאור, המודל מקבל מה שהמאמר מכנה משפטים רב-מודליים: רצף שבו משתלבים זה בזה קטעי טקסט, קידודי תמונה והערכות מצב רציפות מהחיישנים. הקידודים האלה מאומנים מקצה לקצה יחד עם מודל שפה גדול שכבר אומן מראש, וכך נוצר הקישור בין מילה לבין מה שנקלט בפועל.
מאיפה 562 מיליארד הפרמטרים
PaLM-E אינו מודל יחיד אלא משפחה, וכל חבר בה הוא הרכבה של מודל שפה עם מקודד ראייה. הגרסה הגדולה, PaLM-E-562B, מחברת את מודל השפה PaLM בן 540 מיליארד הפרמטרים עם Vision Transformer בן 22 מיליארד; הגרסה הקטנה, PaLM-E-12B, מחברת מודל שפה בן 8 מיליארד עם מקודד ראייה בן 4 מיליארד. במאמר נכתב שלמיטב ידיעת המחברים זהו מודל הראייה-שפה הגדול ביותר שדווח עד אותה נקודה. הגרסה הגדולה גם השיגה תוצאה מיטבית במבחן OK-VQA בלי כיוונון ייעודי לאותה משימה, כלומר היא נשארה מודל ראייה-שפה כללי ולא רק מתכנן לרובוט.
מה הוא עושה עם רובוט
המודל נבחן בשלוש סביבות. הראשונה היא סביבת תכנון שבה הרובוט אוחז ומערים עצמים, ומספר רצפי ההחלטות האפשריים בה עצום ורבים מהם בלתי אפשריים מלכתחילה. השנייה היא שולחן שעליו דוחפים עצמים, מתוך מאגר ציבורי. השלישית היא מניפולציה ניידת במטבח: למצוא חפץ במגירה, להרים אותו ולהביא אותו לאדם. בשתי הסביבות האחרונות PaLM-E משולב בתוך לולאת הבקרה עצמה — הוא מפיק את התוכנית, ואת הצעדים מבצעת בפועל מדיניות נפרדת. בסביבת המטבח המדיניות הזאת היא RT-1; בסביבת השולחן היא מדיניות אחרת, מתוך אותה עבודה שממנה נלקחה הסביבה, ושם PaLM-E מפיק יעדי-ביניים בקצב של פעם בשנייה בעוד המדיניות פולטת פקודות בקצב של חמש פעמים בשנייה. כשמישהו מפריע לרובוט באמצע או כשצעד נכשל, המודל מתכנן מחדש. אחד מקווי ההשוואה בשתי הסביבות הראשונות הוא SayCan — השיטה שבגרסתה עם מודל השפה PaLM נקראת PaLM-SayCan. בסביבת התכנון היא קיבלה פונקציות יכולת מושלמות, כאורקל, ובכל זאת התקשתה לפתור אותה; בסביבת השולחן היא לא פתרה אפילו את המשימה הקלה ביותר שנבדקה.
העברה חיובית, ומה היא חוסכת
הטענה המרכזית של המאמר היא שאימון משותף על תחומים שונים — שפה בקנה מידה אינטרנטי, ראייה, וראייה-שפה — משפר את הביצועים במשימות המגולמות, ולא רק מוסיף להן יכולת נפרדת. ההשלכה המעשית היא חיסכון בנתוני רובוט, שהם המשאב היקר ביותר בתחום: המחברים כיוונו את המודל על 100 משימות ארוכות-טווח שונות עם דוגמת אימון אחת בלבד לכל משימה, והוא הכליל גם לצירופי עצמים חדשים וגם לעצמים שלא הופיעו כלל בנתוני האימון, למשל צב צעצוע.
שכחה קטסטרופלית, ומה שגודל המודל עשה לה
כשמכווננים מודל שפה על נתונים רב-מודליים הוא עלול לאבד את יכולות השפה שלו. המאמר מדד את זה על 21 מבחני שפה כלליים, שמחציתם בודקים הבנת-שפה ומחציתם יצירת-שפה, והתוצאה חדה. בתת-הקבוצה של יצירת-הטקסט: המודל הקטן, בן 12 מיליארד הפרמטרים, איבד 87.3 אחוזים מביצועיו ביחס למודל השפה שממנו נגזר, ואילו המודל הגדול, בן 562 מיליארד, איבד 3.9 אחוזים בלבד. כלומר קנה המידה עצמו הוא שמאפשר להפוך מודל שפה לסוכן מגולם בלי לשלם על כך במחיר הכבד של אובדן השפה — וזו אחת המסקנות שהמאמר מציג במפורש כתרומה שלו.
מה הוא לא עשה, ומי המשיך משם
PaLM-E מפיק טקסט: תוכנית, לא פקודת מנוע. הפער הזה נסגר כעבור כמה חודשים. מאמר RT-2 לקח את PaLM-E בגרסת 12 מיליארד הפרמטרים כאחד משני מודלי הבסיס שלו, וכיוונן אותו כך שיפלוט את הפעולה עצמה כאסימוני טקסט — כלומר הפך אותו למודל ראייה-שפה-פעולה (VLA) — בגרסה שנקראה RT-2-PaLM-E. בהשוואה בין שני הבסיסים דיווח מאמר RT-2 שהגרסה הגדולה יותר, המבוססת על PaLI-X, טובה יותר בהבנת סמלים, בהסקה ובזיהוי אנשים, ואילו הגרסה הקטנה המבוססת על PaLM-E עדיפה דווקא במשימות הנמקה מתמטית — הבדל שהמחברים מייחסים לתערובת קדם-האימון השונה של שני המודלים.