הבעיה שהמאגר נועד לפתור
בתחומים אחרים של למידת מכונה, מודל שאומן על נתונים רחבים ומגוונים מנצח בדרך-כלל מודל צר שאומן על נתוני משימה אחת. ברובוטיקה זה לא קרה, מסיבה מעשית: נהוג לאמן מודל נפרד לכל יישום, לכל דגם רובוט ולעיתים אפילו לכל סביבה, ושינוי של משתנה יחיד מחייב להתחיל כמעט מאפס. איסוף מאגר גדול מספיק כדי לשבור את המעגל הזה יקר מדי עבור מעבדה בודדת. השאלה שהמאמר פותח בה היא אם אפשר לאמן מדיניות אחת שתתאים ליותר מגוף רובוטי אחד — ואם כן, מהם הנתונים שיאפשרו זאת.
מה יש בפנים
המאגר מכיל יותר ממיליון מסלולי-הדגמה אמיתיים, מרובוטים בעלי זרוע אחת ועד רובוטים דו-זרועיים ורובוטים בעלי ארבע רגליים, על פני 22 סוגים של גוף רובוטי. הוא לא נאסף מחדש: הוא הורכב מ-60 מאגרי רובוטיקה קיימים של 34 מעבדות מחקר ברחבי העולם, שהומרו לפורמט נתונים אחיד אחד, RLDS, כדי שאפשר יהיה להוריד את כולם ולטעון אותם באותה דרך. מספר המעבדות תלוי בשאלה איזה חלק במקור קוראים: המספר 34 לקוח מגוף המאמר, שמדבר על מקור המאגרים עצמם; תקציר המאמר מדבר על 21 מוסדות שותפים, והודעת ההשקה על 33 מעבדות אקדמיות. לפי תקציר המאמר, המאגר מדגים 527 מיומנויות שונות ו-160,266 משימות. רוב המיומנויות שייכות למשפחת ההרמה-וההנחה, ובזנב הארוך של ההתפלגות יש גם פעולות כמו ניגוב והרכבה.
ההשקה, ומה שוחרר איתה
Google DeepMind הכריזה על המאגר ב-3 באוקטובר 2023, יחד עם שותפים ממעבדות אקדמיות בעולם, ושחררה לצדו גם נקודת-שמירה מאומנת של מודל שנגזר מ-RT-1 ונקרא RT-1-X. ההשוואה שההודעה עצמה עושה היא ל-ImageNet: כפי שמאגר תמונות אחד קידם את הראייה הממוחשבת, כך מקווים המפרסמים שמאגר הדגמות משותף יקדם את הרובוטיקה. הפרויקט מתואר במאמר כמאמץ קהילתי מתמשך שהמשתתפים בו מקווים להרחיב עם הזמן, לא כמאגר סגור וסופי.
RT-X: המודלים שנועדו להוכיח שהרעיון עובד
כדי לבדוק אם אימון על נתונים מגופים רובוטיים שונים באמת עוזר, אומנו על המאגר שני מודלים: האחד נגזר מהארכיטקטורה של RT-1 ונקרא RT-1-X, והשני נגזר מ-RT-2 ונקרא RT-2-X. התוצאה המרכזית נמדדה על חמישה מאגרים קטנים: שיעור ההצלחה הממוצע של RT-1-X היה גבוה ב-50 אחוזים מזה של השיטה שפיתחו יוצרי אותו מאגר עצמו עבורו. מכיוון ש-RT-1 ו-RT-1-X חולקים בדיוק אותה ארכיטקטורה, המאמר מייחס את ההפרש לאימון המשותף על תערובת הנתונים, ולא לשינוי כלשהו במודל.
היכן זה לא עבד, וגם זו תוצאה
במאגרים הגדולים התמונה התהפכה: RT-1-X לא עלה על RT-1 שאומן על המאגר הייעודי בלבד, סימן שמודל בגודל הזה קטן מכדי לספוג כל-כך הרבה נתונים הטרוגניים. רק המודל הגדול יותר, RT-2-X, שיפר את הביצועים גם שם. במיומנויות מתעוררות — משימות שקיימות בנתונים של רובוט אחר ולא בנתונים של הרובוט הנבחן — RT-2-X היה מוצלח בערך פי שלושה מ-RT-2. הסרת מאגר אחד מסוים מתערובת האימון הורידה את התוצאה הזאת משמעותית — ומכאן, בלשון המאמר עצמו, שייתכן שההעברה מנתוני הרובוט האחר היא האחראית לה. המאמר נזהר בניסוח הזה ואינו קובע זאת כמסקנה. במבחני הכללה רגילים, לעומת זאת, RT-2 ו-RT-2-X נמצאו שקולים בערך.
למה זה הפך לתשתית של התחום
החשיבות של המאגר ניכרת פחות במודלים שאומנו עליו במאמר עצמו, ויותר במודלי ראייה-שפה-פעולה (VLA) שנבנו מעליו אחר-כך. OpenVLA אומן על 970 אלף פרקים מתוכו — וזה מספר של OpenVLA, לא גודלו של המאגר כולו. π₀ משתמש בו כרכיב אחד בתערובת קדם-אימון גדולה עוד יותר — כשמאמרו עצמו אינו עקבי בשאלה אם נלקח המאגר כולו או תת-קבוצה שלו. מנגד, המחברים עצמם מסייגים: הניסויים אינם כוללים רובוטים בעלי חישה והנעה שונות מאוד מאלה שבמאגר, אינם בודקים הכללה לרובוט חדש לגמרי, ואינם מספקים אמת-מידה שתנבא מראש מתי העברה חיובית בין גופים תתרחש ומתי לא.