OpenVLA — מודל ראייה-שפה-פעולה עם משקלות פתוחים

רובוטיקה

הגדרה

OpenVLA הוא מודל ראייה-שפה-פעולה בקוד-פתוח, שפרסם ביוני 2024 קונסורציום אקדמי ותעשייתי, ושחשף משקלות וקוד-אימון פתוחים לחלוטין בשעה שהמודלים המובילים בתחום נותרו קנייניים.

ההסבר הכללי של מודל ראייה-שפה-פעולה (VLA) — מה זה, ואיך פועל התרגום מהוראה חזותית-לשונית לפקודת-תנועה — נמצא בערך הנפרד. OpenVLA עצמו, שפורסם ביוני 2024, אינו המודל הראשון מהסוג הזה: RT-2 של Google DeepMind קדם לו כמעט שנה. מה שמייחד את OpenVLA הוא כיוון הפוך: במקום מודל קנייני שרץ רק על רובוטים של חברה אחת, כל מה שדרוש כדי לשחזר או לכוונן-מחדש את OpenVLA פתוח לציבור — המשקלות, קוד-האימון בפייתון, ורשימת מאגרי-הנתונים ששימשו לאימון, כולם זמינים להורדה ולכיוונון-עצמאי.

בראש הפרויקט עמדו כחוקרים-מובילים מוג'ין קים, קארל פרטש וסידהארת' קרמצ'טי, ומאחוריהם קונסורציום רחב: חוקרים מאוניברסיטת סטנפורד, אוניברסיטת קליפורניה בברקלי, Toyota Research Institute, Google DeepMind, Physical Intelligence ו-MIT — חלקם אותם חוקרים שהיו שותפים גם לפיתוח RT-2. המודל בנוי על שילוב של מודל-השפה Llama 2 עם מקודד-ראייה שממזג שני מודלים קיימים, DINOv2 ו-SigLIP, ואומן על כמעט מיליון הדגמות-רובוט אמיתיות — 970 אלף פרקים — שנאספו במאגר המשותף Open X-Embodiment, פרויקט שריכז נתונים מעשרות מעבדות-רובוטיקה שונות ברחבי העולם.

בגודלו OpenVLA צנוע יחסית: 7 מיליארד פרמטרים, לעומת עד 55 מיליארד ב-RT-2. ובכל זאת, לפי מאמר-המקור, הוא עלה ב-16.5 נקודות-אחוז בשיעור-ההצלחה על RT-2-X — מודל באותו סדר-גודל, 55 מיליארד פרמטרים, שהוא RT-2 שאומן גם על נתונים מן המאגר המשותף Open X-Embodiment ולא רק על נתוני הרובוט של Google — על פני 29 משימות וכמה סוגי-רובוטים שונים, עם פי-7 פחות פרמטרים. הוא עלה גם על Diffusion Policy, שיטת-חיקוי מתקדמת שמאומנת מאפס בלי כל ידע-עולם קודם, ב-20.4 נקודות-אחוז. הפער נובע, בין השאר, מהשילוב של שני מקודדי-ראייה משלימים ומהיקף הנתונים המגוונים שעליהם אומן, לא רק מגודל הרשת.

העובדה שהמשקלות פתוחות משמעה שכל מעבדת-רובוטיקה יכולה להוריד את OpenVLA מ-HuggingFace ולכוונן אותו מחדש למשימה חדשה בלי לבנות מודל-יסוד משלה מאפס — בדומה לאופן שבו קוד פתוח שינה בעבר תחומים אחרים בבינה מלאכותית. לפי מאמר-המקור, אפשר גם לכוונן את OpenVLA על מחשב יחיד עם כרטיס-מסך רגיל, בעזרת שיטות-כיוונון חסכוניות-בפרמטרים כמו LoRA, ולהריץ אותו ביעילות בעזרת קוונטיזציה — כך שהנגישות אינה רק תיאורטית אלא גם מעשית עבור מעבדה שאין לה תשתית-ענן של חברת-ענק.