מה זה RT-2, ולמה יש לו ערך נפרד מהמושג הכללי
ההסבר הכללי של מודל ראייה-שפה-פעולה (VLA) — מה זה המושג, ואיך פועל התעלול שהופך פקודת-תנועה למחרוזת-טקסט — נמצא בערך הנפרד. הערך הזה עוסק ב-RT-2 עצמו: המודל שהציג את הגישה בפועל, מי בנה אותו, מתי, ובמה בדיוק הוא שונה מקודמו. RT-2 פורסם בידי Google DeepMind ב-28 ביולי 2023, במאמר שגם טבע את השם מודל ראייה-שפה-פעולה לקטגוריה כולה. המודל נבחן על אותם רובוטים ניידים של Google ששימשו גם לאימון RT-1, כדי שההשוואה בין השניים תהיה הוגנת ולא תלויה בשינוי חומרה.
ההבדל מ-RT-1: לא רק שיפור, אלא שינוי-גישה
RT-1, שפורסם כשמונה חודשים קודם לכן, אומן מאפס אך ורק על נתוני-רובוט: מאגר של 130 אלף פרקי-התנסות ומעל 700 משימות, שנאסף בעזרת צי של 13 רובוטים לאורך 17 חודשים, ברשת קטנה יחסית של כ-35 מיליון פרמטרים. RT-2 ויתר על אימון-מאפס. הוא לוקח מודל ראייה-שפה גדול שכבר אומן מראש על טקסט ותמונות מהאינטרנט — PaLM-E בגרסת 12 מיליארד פרמטרים, או PaLI-X בגרסת 55 מיליארד — ומכוון אותו מחדש גם על נתוני-האינטרנט וגם על נתוני-הרובוט יחד, כדי שהידע מהרשת יישאר זמין לרובוט. המאמר בדק גם גרסה קטנה יותר של PaLI-X, בת 5 מיליארד פרמטרים בלבד, מול הגרסה בת 55 המיליארד: ביצועי-ההכללה לתרחישים לא-מוכרים עלו מ-44 אחוזים ל-63 אחוזים, כלומר קנה-המידה של מודל-הבסיס משפיע ישירות על התוצאה.
הנתון המרכזי, כפי שפרסמה Google DeepMind
RT-2 שמר על הביצועים במשימות המקוריות שהופיעו בנתוני הרובוט, ושיפר את הביצועים בתרחישים שהרובוט לא ראה קודם, מ-32 אחוזים של RT-1 ל-62 אחוזים. אלה שני מודלים שונים שנמדדו על אותו מבחן, לא מדידה של מודל אחד לפני ואחרי, וההערכה נשענה על יותר משישת אלפים ניסויים על רובוטים אמיתיים.
יכולות ספציפיות שקפצו: סמלים והסקה
המאמר האקדמי שפורסם באותו זמן מתעד גם קפיצות ממוקדות יותר. במשימת זיהוי-סמלים — למשל הנחת חפץ ליד סמל מסוים — RT-2-PaLI-X הגיע ל-93 אחוזים הצלחה, לעומת 27 אחוזים בלבד ל-RT-1. על פני כל קטגוריות היכולות המתעוררות יחד — סמלים, הסקה וזיהוי-אנשים — RT-2-PaLI-X עלה על RT-1 ביותר מפי שלושה, לפי המאמר עצמו.
גרסת שרשור-המחשבה
גרסה נוספת של RT-2 עברה כיוונון-עדין על נתונים המנוסחים כשרשור-מחשבה: לפני שהמודל פולט את פקודת-התנועה, הוא כותב תחילה משפט-ביניים שמסביר בשפה מה מטרת הפעולה ומה השלב הבא שצריך לקרות. הצעד הזה מאפשר לאותו מודל ללמוד גם תכנון-לטווח-ארוך וגם מיומנויות-תנועה-מדויקות במסגרת אחת, ולא בשני מודלים נפרדים.
מה עדיין נשאר סגור, ומי המשיך משם
RT-2 נשאר מודל קנייני של Google: המשקלות והקוד לא פורסמו, וההרצה מוגבלת לרובוטים של החברה עצמה. יש לכך גם סיבה טכנית — גרסת ה-55 מיליארד גדולה מכדי לרוץ על מחשב-רובוט רגיל, ולכן המפתחים הריצו אותה בענן, על שירות רב-TPU שנשאל דרך הרשת; הקצב שהתקבל כך הוא 1 עד 3 הרצים בשנייה, לעומת 3 ההרצים הקבועים של RT-1 שרץ מקומית. בדיוק הפער הזה — מודל חזק שאי-אפשר לגעת בו — הוא שהניע ב-2024 את OpenVLA: מודל בגודל צנוע בהרבה, 7 מיליארד פרמטרים בלבד, שקוד-האימון והמשקלות שלו פתוחים לגמרי, והצליח לעלות בביצועים על RT-2-X — מודל בן 55 מיליארד פרמטרים שנגזר מ-RT-2 ואומן גם על נתוני-רובוט ממעבדות רבות, לא רק על נתוני הרובוט של Google — על פני 29 משימות שונות ומגוון סוגי-רובוטים.