PaLM-E — מודל-שפה מגולם בן 562 מיליארד; עליו נבנה RT-2

רובוטיקה

הגדרה

PaLM-E הוא מודל שפה מגלם שהציגה Google במרץ 2023, המזרים תמונות ונתוני חיישנים ישירות לתוך מודל שפה גדול ומפיק מהם תוכנית פעולה לרובוט בשפה טבעית.

הרעיון: משפט שאינו רק מילים

מודלי שפה גדולים כמו PaLM מצטיינים במשימות מורכבות, אבל כשמבקשים מהם לפעול בעולם האמיתי צצה בעיית העיגון: המילים אינן מחוברות לשום דבר שהמערכת רואה או חשה. PaLM-E מציע לפתור זאת בקלט עצמו. במקום לתאר את הסצנה במילים ולהזין את התיאור, המודל מקבל מה שהמאמר מכנה משפטים רב-מודליים: רצף שבו משתלבים זה בזה קטעי טקסט, קידודי תמונה והערכות מצב רציפות מהחיישנים. הקידודים האלה מאומנים מקצה לקצה יחד עם מודל שפה גדול שכבר אומן מראש, וכך נוצר הקישור בין מילה לבין מה שנקלט בפועל.

מאיפה 562 מיליארד הפרמטרים

PaLM-E אינו מודל יחיד אלא משפחה, וכל חבר בה הוא הרכבה של מודל שפה עם מקודד ראייה. הגרסה הגדולה, PaLM-E-562B, מחברת את מודל השפה PaLM בן 540 מיליארד הפרמטרים עם Vision Transformer בן 22 מיליארד; הגרסה הקטנה, PaLM-E-12B, מחברת מודל שפה בן 8 מיליארד עם מקודד ראייה בן 4 מיליארד. במאמר נכתב שלמיטב ידיעת המחברים זהו מודל הראייה-שפה הגדול ביותר שדווח עד אותה נקודה. הגרסה הגדולה גם השיגה תוצאה מיטבית במבחן OK-VQA בלי כיוונון ייעודי לאותה משימה, כלומר היא נשארה מודל ראייה-שפה כללי ולא רק מתכנן לרובוט.

מה הוא עושה עם רובוט

המודל נבחן בשלוש סביבות. הראשונה היא סביבת תכנון שבה הרובוט אוחז ומערים עצמים, ומספר רצפי ההחלטות האפשריים בה עצום ורבים מהם בלתי אפשריים מלכתחילה. השנייה היא שולחן שעליו דוחפים עצמים, מתוך מאגר ציבורי. השלישית היא מניפולציה ניידת במטבח: למצוא חפץ במגירה, להרים אותו ולהביא אותו לאדם. בשתי הסביבות האחרונות PaLM-E משולב בתוך לולאת הבקרה עצמה — הוא מפיק את התוכנית, ואת הצעדים מבצעת בפועל מדיניות נפרדת. בסביבת המטבח המדיניות הזאת היא RT-1; בסביבת השולחן היא מדיניות אחרת, מתוך אותה עבודה שממנה נלקחה הסביבה, ושם PaLM-E מפיק יעדי-ביניים בקצב של פעם בשנייה בעוד המדיניות פולטת פקודות בקצב של חמש פעמים בשנייה. כשמישהו מפריע לרובוט באמצע או כשצעד נכשל, המודל מתכנן מחדש. אחד מקווי ההשוואה בשתי הסביבות הראשונות הוא SayCan — השיטה שבגרסתה עם מודל השפה PaLM נקראת PaLM-SayCan. בסביבת התכנון היא קיבלה פונקציות יכולת מושלמות, כאורקל, ובכל זאת התקשתה לפתור אותה; בסביבת השולחן היא לא פתרה אפילו את המשימה הקלה ביותר שנבדקה.

העברה חיובית, ומה היא חוסכת

הטענה המרכזית של המאמר היא שאימון משותף על תחומים שונים — שפה בקנה מידה אינטרנטי, ראייה, וראייה-שפה — משפר את הביצועים במשימות המגולמות, ולא רק מוסיף להן יכולת נפרדת. ההשלכה המעשית היא חיסכון בנתוני רובוט, שהם המשאב היקר ביותר בתחום: המחברים כיוונו את המודל על 100 משימות ארוכות-טווח שונות עם דוגמת אימון אחת בלבד לכל משימה, והוא הכליל גם לצירופי עצמים חדשים וגם לעצמים שלא הופיעו כלל בנתוני האימון, למשל צב צעצוע.

שכחה קטסטרופלית, ומה שגודל המודל עשה לה

כשמכווננים מודל שפה על נתונים רב-מודליים הוא עלול לאבד את יכולות השפה שלו. המאמר מדד את זה על 21 מבחני שפה כלליים, שמחציתם בודקים הבנת-שפה ומחציתם יצירת-שפה, והתוצאה חדה. בתת-הקבוצה של יצירת-הטקסט: המודל הקטן, בן 12 מיליארד הפרמטרים, איבד 87.3 אחוזים מביצועיו ביחס למודל השפה שממנו נגזר, ואילו המודל הגדול, בן 562 מיליארד, איבד 3.9 אחוזים בלבד. כלומר קנה המידה עצמו הוא שמאפשר להפוך מודל שפה לסוכן מגולם בלי לשלם על כך במחיר הכבד של אובדן השפה — וזו אחת המסקנות שהמאמר מציג במפורש כתרומה שלו.

מה הוא לא עשה, ומי המשיך משם

PaLM-E מפיק טקסט: תוכנית, לא פקודת מנוע. הפער הזה נסגר כעבור כמה חודשים. מאמר RT-2 לקח את PaLM-E בגרסת 12 מיליארד הפרמטרים כאחד משני מודלי הבסיס שלו, וכיוונן אותו כך שיפלוט את הפעולה עצמה כאסימוני טקסט — כלומר הפך אותו למודל ראייה-שפה-פעולה (VLA) — בגרסה שנקראה RT-2-PaLM-E. בהשוואה בין שני הבסיסים דיווח מאמר RT-2 שהגרסה הגדולה יותר, המבוססת על PaLI-X, טובה יותר בהבנת סמלים, בהסקה ובזיהוי אנשים, ואילו הגרסה הקטנה המבוססת על PaLM-E עדיפה דווקא במשימות הנמקה מתמטית — הבדל שהמחברים מייחסים לתערובת קדם-האימון השונה של שני המודלים.

שאלות נפוצות ❓

מה המשמעות של 'מגלם' (Embodied) בשם?

שהמודל אומן עם נתונים שמגיעים מגוף פיזי — תמונות ממצלמות והערכות מצב רציפות — ולא רק עם טקסט. הכותרת של המאמר עצמה נושאת את המילה, וזה תיאור עצמי של המחברים ולא תיוג מאוחר. הרעיון הרחב יותר שמאחורי זה מוסבר בערך על בינה מלאכותית מגולמת.

האם PaLM-E הוא מודל ראייה-שפה-פעולה?

לא בפני עצמו. הוא מפיק תוכנית בשפה, ומדיניות נפרדת מבצעת אותה — בסביבת המטבח זו RT-1, ובסביבת השולחן מדיניות אחרת. מודל ראייה-שפה-פעולה פולט את פקודת התנועה עצמה. המעבר הזה נעשה ב-RT-2, שכיוונן מחדש את PaLM-E בגרסת 12 מיליארד הפרמטרים כדי שיפלוט פעולה במקום תוכנית.

למה צריך מודל כל-כך גדול?

אחת התוצאות המרכזיות במאמר נוגעת בדיוק לזה. ככל שמודל השפה גדול יותר, כך הוא מאבד פחות מיכולות השפה שלו בזמן האימון הרב-מודלי: המודל בן 12 מיליארד הפרמטרים איבד 87.3 אחוזים מביצועי יצירת הטקסט שלו, והמודל בן 562 מיליארד איבד 3.9 אחוזים בלבד. גודל הוא כאן לא רק ביצועים, אלא גם שימור.

מי פיתח אותו ומתי?

המאמר הועלה ל-arXiv ב-6 במרץ 2023 ופורסם בבלוג המחקר של Google ב-10 באותו חודש. לפי דף הפרויקט, המחברים משתייכים לשני צוותי מחקר של Google ולאוניברסיטה הטכנית של ברלין.

מה הקשר ל-PaLM-SayCan?

PaLM-E שימש כדי לתקוף את אותה בעיה בגישה אחרת, והמאמר משתמש ב-SayCan כקו בסיס. המסקנה שהוא מדווח היא שפונקציות היכולת של SayCan מגבילות רק את מה שאפשרי ברגע הנוכחי, ואינן נושאות מספיק מידע כדי שמודל השפה יבנה מהן תוכנית ארוכת-טווח בסביבות תכנון מורכבות — וזאת אף שבניסוי הזה הן ניתנו לה מושלמות, כאורקל, ולא נלמדו.