RT-2 — מודל ראייה-שפה-פעולה של Google DeepMind

רובוטיקה

הגדרה

RT-2 הוא מודל-הרובוטיקה שפרסמה Google DeepMind ביולי 2023 — המודל שהציג בפועל את גישת ראייה-שפה-פעולה וטבע את שמה, בכך שהראה שאפשר לכוונן מחדש מודל ראייה-שפה גדול שאומן על נתוני-אינטרנט כדי שיפלוט ישירות פקודות-תנועה לרובוט.

מה זה RT-2, ולמה יש לו ערך נפרד מהמושג הכללי

ההסבר הכללי של מודל ראייה-שפה-פעולה (VLA) — מה זה המושג, ואיך פועל התעלול שהופך פקודת-תנועה למחרוזת-טקסט — נמצא בערך הנפרד. הערך הזה עוסק ב-RT-2 עצמו: המודל שהציג את הגישה בפועל, מי בנה אותו, מתי, ובמה בדיוק הוא שונה מקודמו. RT-2 פורסם בידי Google DeepMind ב-28 ביולי 2023, במאמר שגם טבע את השם מודל ראייה-שפה-פעולה לקטגוריה כולה. המודל נבחן על אותם רובוטים ניידים של Google ששימשו גם לאימון RT-1, כדי שההשוואה בין השניים תהיה הוגנת ולא תלויה בשינוי חומרה.

ההבדל מ-RT-1: לא רק שיפור, אלא שינוי-גישה

RT-1, שפורסם כשמונה חודשים קודם לכן, אומן מאפס אך ורק על נתוני-רובוט: מאגר של 130 אלף פרקי-התנסות ומעל 700 משימות, שנאסף בעזרת צי של 13 רובוטים לאורך 17 חודשים, ברשת קטנה יחסית של כ-35 מיליון פרמטרים. RT-2 ויתר על אימון-מאפס. הוא לוקח מודל ראייה-שפה גדול שכבר אומן מראש על טקסט ותמונות מהאינטרנט — PaLM-E בגרסת 12 מיליארד פרמטרים, או PaLI-X בגרסת 55 מיליארד — ומכוון אותו מחדש גם על נתוני-האינטרנט וגם על נתוני-הרובוט יחד, כדי שהידע מהרשת יישאר זמין לרובוט. המאמר בדק גם גרסה קטנה יותר של PaLI-X, בת 5 מיליארד פרמטרים בלבד, מול הגרסה בת 55 המיליארד: ביצועי-ההכללה לתרחישים לא-מוכרים עלו מ-44 אחוזים ל-63 אחוזים, כלומר קנה-המידה של מודל-הבסיס משפיע ישירות על התוצאה.

הנתון המרכזי, כפי שפרסמה Google DeepMind

RT-2 שמר על הביצועים במשימות המקוריות שהופיעו בנתוני הרובוט, ושיפר את הביצועים בתרחישים שהרובוט לא ראה קודם, מ-32 אחוזים של RT-1 ל-62 אחוזים. אלה שני מודלים שונים שנמדדו על אותו מבחן, לא מדידה של מודל אחד לפני ואחרי, וההערכה נשענה על יותר משישת אלפים ניסויים על רובוטים אמיתיים.

יכולות ספציפיות שקפצו: סמלים והסקה

המאמר האקדמי שפורסם באותו זמן מתעד גם קפיצות ממוקדות יותר. במשימת זיהוי-סמלים — למשל הנחת חפץ ליד סמל מסוים — RT-2-PaLI-X הגיע ל-93 אחוזים הצלחה, לעומת 27 אחוזים בלבד ל-RT-1. על פני כל קטגוריות היכולות המתעוררות יחד — סמלים, הסקה וזיהוי-אנשים — RT-2-PaLI-X עלה על RT-1 ביותר מפי שלושה, לפי המאמר עצמו.

גרסת שרשור-המחשבה

גרסה נוספת של RT-2 עברה כיוונון-עדין על נתונים המנוסחים כשרשור-מחשבה: לפני שהמודל פולט את פקודת-התנועה, הוא כותב תחילה משפט-ביניים שמסביר בשפה מה מטרת הפעולה ומה השלב הבא שצריך לקרות. הצעד הזה מאפשר לאותו מודל ללמוד גם תכנון-לטווח-ארוך וגם מיומנויות-תנועה-מדויקות במסגרת אחת, ולא בשני מודלים נפרדים.

מה עדיין נשאר סגור, ומי המשיך משם

RT-2 נשאר מודל קנייני של Google: המשקלות והקוד לא פורסמו, וההרצה מוגבלת לרובוטים של החברה עצמה. יש לכך גם סיבה טכנית — גרסת ה-55 מיליארד גדולה מכדי לרוץ על מחשב-רובוט רגיל, ולכן המפתחים הריצו אותה בענן, על שירות רב-TPU שנשאל דרך הרשת; הקצב שהתקבל כך הוא 1 עד 3 הרצים בשנייה, לעומת 3 ההרצים הקבועים של RT-1 שרץ מקומית. בדיוק הפער הזה — מודל חזק שאי-אפשר לגעת בו — הוא שהניע ב-2024 את OpenVLA: מודל בגודל צנוע בהרבה, 7 מיליארד פרמטרים בלבד, שקוד-האימון והמשקלות שלו פתוחים לגמרי, והצליח לעלות בביצועים על RT-2-X — מודל בן 55 מיליארד פרמטרים שנגזר מ-RT-2 ואומן גם על נתוני-רובוט ממעבדות רבות, לא רק על נתוני הרובוט של Google — על פני 29 משימות שונות ומגוון סוגי-רובוטים.

שלושה מודלים באותה משפחה: RT-1, RT-2 ו-OpenVLA
RT-1RT-2OpenVLA
מי פיתח, ומתיGoogle, דצמבר 2022Google DeepMind, יולי 2023קונסורציום אקדמי (סטנפורד, ברקלי ואחרים), יוני 2024
גודל המודלכ-35 מיליון פרמטריםעד 55 מיליארד פרמטרים (PaLI-X)7 מיליארד פרמטרים
מקור הידערק נתוני-רובוט אמיתייםנתוני-רובוט ונתוני-אינטרנט יחדנתוני-רובוט ונתוני-אינטרנט יחד
קוד ומשקלות פתוחים?לאלאכן
הצלחה בתרחישים לא-מוכרים (RT-1 מול RT-2, אותו מבחן)32%62%לא נמדד על אותו מבחן
יתרון-הצלחה מול RT-2-X (55B), במדגם-משימות נפרד של OpenVLAלא רלוונטילא רלוונטי16.5 נקודות-אחוז (ממוצע על 29 משימות)

שאלות נפוצות ❓

מה ההבדל המרכזי בין RT-1 ל-RT-2?

RT-1 אומן מאפס על נתוני-רובוט בלבד, ברשת קטנה של כ-35 מיליון פרמטרים. RT-2 לוקח מודל ראייה-שפה גדול שכבר אומן על טקסט ותמונות מהאינטרנט — עד 55 מיליארד פרמטרים — ומכוונן אותו מחדש גם על נתוני-האינטרנט וגם על נתוני-הרובוט יחד, כדי שהידע מהרשת יישאר זמין לרובוט.

מה בדיוק אומר הנתון 32 ואחר-כך 62 אחוזים?

בתרחישים שהרובוט לא ראה קודם, RT-1 הצליח ב-32 אחוזים מהמקרים ו-RT-2 ב-62 אחוזים. אלה שני מודלים שונים שנמדדו על אותו מבחן, לא מדידה של מודל אחד לפני שיפור ואחריו, והמספר תקף לתרחישים הלא-מוכרים בלבד, לא לשיעור ההצלחה הכולל.

מה זה שרשור-מחשבה ב-RT-2?

גרסה מכווננת-נוספת של RT-2 שלפני פליטת פקודת-התנועה כותבת משפט-ביניים שמסביר בשפה את מטרת הפעולה והשלב הבא. כך אותו מודל לומד גם תכנון-לטווח-ארוך וגם ביצוע מדויק, במקום להפריד אותם לשני מודלים.

האם RT-2 בקוד פתוח?

לא. המשקלות והקוד של RT-2 נשארו קנייניים ל-Google, וההרצה מוגבלת לרובוטים של החברה. הפער הזה הניע ב-2024 את פרויקט OpenVLA, שפרסם משקלות וקוד-אימון פתוחים לחלוטין.

אילו יכולות ספציפיות השתפרו הכי הרבה מ-RT-1 ל-RT-2?

לפי המאמר האקדמי, בזיהוי-סמלים RT-2-PaLI-X הגיע ל-93 אחוזים לעומת 27 אחוזים ל-RT-1, ועל פני כל קטגוריות היכולות המתעוררות יחד — סמלים, הסקה וזיהוי-אנשים — RT-2-PaLI-X עלה על RT-1 ביותר מפי שלושה.