Open X-Embodiment — מאגר-ההדגמות שעליו אומנו RT-X, OpenVLA ואחרים

רובוטיקה

הגדרה

Open X-Embodiment הוא מאגר נתונים פתוח ומשותף לרובוטיקה, שהושק באוקטובר 2023 ואיחד מאגרים קיימים של מעבדות מחקר בעולם ליותר ממיליון מסלולי-הדגמה על 22 סוגי גוף רובוטי.

הבעיה שהמאגר נועד לפתור

בתחומים אחרים של למידת מכונה, מודל שאומן על נתונים רחבים ומגוונים מנצח בדרך-כלל מודל צר שאומן על נתוני משימה אחת. ברובוטיקה זה לא קרה, מסיבה מעשית: נהוג לאמן מודל נפרד לכל יישום, לכל דגם רובוט ולעיתים אפילו לכל סביבה, ושינוי של משתנה יחיד מחייב להתחיל כמעט מאפס. איסוף מאגר גדול מספיק כדי לשבור את המעגל הזה יקר מדי עבור מעבדה בודדת. השאלה שהמאמר פותח בה היא אם אפשר לאמן מדיניות אחת שתתאים ליותר מגוף רובוטי אחד — ואם כן, מהם הנתונים שיאפשרו זאת.

מה יש בפנים

המאגר מכיל יותר ממיליון מסלולי-הדגמה אמיתיים, מרובוטים בעלי זרוע אחת ועד רובוטים דו-זרועיים ורובוטים בעלי ארבע רגליים, על פני 22 סוגים של גוף רובוטי. הוא לא נאסף מחדש: הוא הורכב מ-60 מאגרי רובוטיקה קיימים של 34 מעבדות מחקר ברחבי העולם, שהומרו לפורמט נתונים אחיד אחד, RLDS, כדי שאפשר יהיה להוריד את כולם ולטעון אותם באותה דרך. מספר המעבדות תלוי בשאלה איזה חלק במקור קוראים: המספר 34 לקוח מגוף המאמר, שמדבר על מקור המאגרים עצמם; תקציר המאמר מדבר על 21 מוסדות שותפים, והודעת ההשקה על 33 מעבדות אקדמיות. לפי תקציר המאמר, המאגר מדגים 527 מיומנויות שונות ו-160,266 משימות. רוב המיומנויות שייכות למשפחת ההרמה-וההנחה, ובזנב הארוך של ההתפלגות יש גם פעולות כמו ניגוב והרכבה.

ההשקה, ומה שוחרר איתה

Google DeepMind הכריזה על המאגר ב-3 באוקטובר 2023, יחד עם שותפים ממעבדות אקדמיות בעולם, ושחררה לצדו גם נקודת-שמירה מאומנת של מודל שנגזר מ-RT-1 ונקרא RT-1-X. ההשוואה שההודעה עצמה עושה היא ל-ImageNet: כפי שמאגר תמונות אחד קידם את הראייה הממוחשבת, כך מקווים המפרסמים שמאגר הדגמות משותף יקדם את הרובוטיקה. הפרויקט מתואר במאמר כמאמץ קהילתי מתמשך שהמשתתפים בו מקווים להרחיב עם הזמן, לא כמאגר סגור וסופי.

RT-X: המודלים שנועדו להוכיח שהרעיון עובד

כדי לבדוק אם אימון על נתונים מגופים רובוטיים שונים באמת עוזר, אומנו על המאגר שני מודלים: האחד נגזר מהארכיטקטורה של RT-1 ונקרא RT-1-X, והשני נגזר מ-RT-2 ונקרא RT-2-X. התוצאה המרכזית נמדדה על חמישה מאגרים קטנים: שיעור ההצלחה הממוצע של RT-1-X היה גבוה ב-50 אחוזים מזה של השיטה שפיתחו יוצרי אותו מאגר עצמו עבורו. מכיוון ש-RT-1 ו-RT-1-X חולקים בדיוק אותה ארכיטקטורה, המאמר מייחס את ההפרש לאימון המשותף על תערובת הנתונים, ולא לשינוי כלשהו במודל.

היכן זה לא עבד, וגם זו תוצאה

במאגרים הגדולים התמונה התהפכה: RT-1-X לא עלה על RT-1 שאומן על המאגר הייעודי בלבד, סימן שמודל בגודל הזה קטן מכדי לספוג כל-כך הרבה נתונים הטרוגניים. רק המודל הגדול יותר, RT-2-X, שיפר את הביצועים גם שם. במיומנויות מתעוררות — משימות שקיימות בנתונים של רובוט אחר ולא בנתונים של הרובוט הנבחן — RT-2-X היה מוצלח בערך פי שלושה מ-RT-2. הסרת מאגר אחד מסוים מתערובת האימון הורידה את התוצאה הזאת משמעותית — ומכאן, בלשון המאמר עצמו, שייתכן שההעברה מנתוני הרובוט האחר היא האחראית לה. המאמר נזהר בניסוח הזה ואינו קובע זאת כמסקנה. במבחני הכללה רגילים, לעומת זאת, RT-2 ו-RT-2-X נמצאו שקולים בערך.

למה זה הפך לתשתית של התחום

החשיבות של המאגר ניכרת פחות במודלים שאומנו עליו במאמר עצמו, ויותר במודלי ראייה-שפה-פעולה (VLA) שנבנו מעליו אחר-כך. OpenVLA אומן על 970 אלף פרקים מתוכו — וזה מספר של OpenVLA, לא גודלו של המאגר כולו. π₀ משתמש בו כרכיב אחד בתערובת קדם-אימון גדולה עוד יותר — כשמאמרו עצמו אינו עקבי בשאלה אם נלקח המאגר כולו או תת-קבוצה שלו. מנגד, המחברים עצמם מסייגים: הניסויים אינם כוללים רובוטים בעלי חישה והנעה שונות מאוד מאלה שבמאגר, אינם בודקים הכללה לרובוט חדש לגמרי, ואינם מספקים אמת-מידה שתנבא מראש מתי העברה חיובית בין גופים תתרחש ומתי לא.

שאלות נפוצות ❓

מה זה 'גוף רובוטי' (embodiment) בהקשר הזה?

סוג הרובוט הפיזי שהנתונים נאספו עליו: לפי המאמר, מזרוע יחידה ועד מערכות דו-זרועיות ורובוטים בעלי ארבע רגליים. המאגר מאגד נתונים מ-22 סוגים כאלה, וזו בדיוק הנקודה — הרעיון הוא לבדוק אם מודל אחד יכול ללמוד מנתונים של גופים שונים זה מזה, במקום שכל גוף יקבל מודל משלו.

המאגר מכיל 970 אלף פרקים?

לא. 970 אלף הוא מספר הפרקים ש-OpenVLA אומן עליהם מתוך המאגר, כלומר תת-קבוצה שנבחרה לצורך אימון מסוים. המאגר עצמו מכיל יותר ממיליון מסלולי-הדגמה, ולפי תקציר המאמר 527 מיומנויות ו-160,266 משימות.

מי יכול להשתמש בו?

המאגר ונקודת-השמירה של RT-1-X שוחררו לשימוש קהילת המחקר הרחבה, בפורמט RLDS שנועד להורדה ולטעינה אחידה במסגרות למידה עמוקה נפוצות. הפירוט המלא של 60 המאגרים המרכיבים אותו אינו בדף הפרויקט עצמו אלא בגיליון אלקטרוני שמקושר ממנו.

האם אימון על נתונים מרובוטים אחרים תמיד עוזר?

לא, והמאמר מראה זאת במפורש. בתחומים שכבר יש בהם הרבה נתונים, RT-1-X לא עלה על מודל שאומן על אותו מאגר בלבד — הוא פשוט קטן מכדי לספוג את המגוון. רק המודל הגדול יותר, RT-2-X, הרוויח מההעברה גם שם. כלומר התועלת תלויה בקיבולת המודל, ולא מובטחת מראש.

מה הקשר בין המאגר למודלים כמו OpenVLA ו-π₀?

שניהם נשענים עליו. OpenVLA אומן על 970 אלף פרקים מתוכו, ואילו π₀ משתמש בו כרכיב אחד בתערובת קדם-אימון שכוללת גם 10,000 שעות הדגמה שנאספו בידי המפתחים עצמם — כשמאמר π₀ עצמו אינו עקבי בשאלה אם נלקח המאגר כולו או תת-קבוצה שלו. זו הסיבה שהמאגר נחשב תשתית ולא עוד ניסוי בודד.