מה הערך הזה מכסה, ומה כתוב במקום אחר
π₀ (בהגייה pi-zero, ונכתב גם π0) הוא מודל יסוד לרובוטים שפורסם ב-31 באוקטובר 2024, במאמר שמכנה מודלים מהסוג הזה מדיניות כללית לרובוט. הערך הזה עוסק במאמר ובמודל עצמם: מה הם מציעים טכנית, על אילו נתונים המודל אומן, ומה נמדד בו בפועל. סיפור החברה שמאחוריו — מתי נוסדה, מי מימן אותה ואילו דורות יצאו אחריו — נמצא בערך הנפרד על Physical Intelligence, ואינו נשנה כאן. ההסבר הכללי של מודל ראייה-שפה-פעולה (VLA) נמצא אף הוא בערך משלו. הודעת החברה שליוותה את הפרסום מנסחת את המוטיבציה דרך פרדוקס מורבק: ניצחון במשחק שחמט או גילוי תרופה חדשה הם בעיות קלות יחסית לבינה מלאכותית, ואילו קיפול חולצה או פינוי שולחן דורשים לפתור כמה מבעיות ההנדסה הקשות שהוצבו אי-פעם.
הארכיטקטורה: מודל ראייה-שפה, ומעליו מומחה-פעולה
השלד של π₀ הוא PaliGemma, מודל ראייה-שפה פתוח בן שלושה מיליארד פרמטרים, שאליו נוספו כ-300 מיליון פרמטרים של רכיב שהמאמר מכנה מומחה-פעולה — ובסך-הכול כ-3.3 מיליארד. חלוקת התפקידים ברורה: השלד מביא ידע סמנטי שנלמד בקנה-מידה אינטרנטי, ומומחה-הפעולה הופך אותו לפקודות תנועה. החיבור בין השניים נעשה בהתאמת-זרימה (flow matching), שיטה שהמאמר מתאר כווריאנט של דיפוזיה, והיא שמאפשרת למודל לשלוט ברובוטים בתדר של עד 50 פקודות בשנייה. כדאי לדייק מה נפלט ומתי: הרצף אינו נבנה מחדש 50 פעמים בשנייה. המודל פולט בכל פעם רצף שלם של 50 פעולות עתידיות, מריץ ממנו 25 ורק אז פונה לרצף הבא — כלומר חישוב אחד כל חצי שנייה בערך, שמזין בקרה בתדר גבוה. לפי המאמר, זו בדיוק הנקודה שבה מודלים קודמים שכתבו את הפעולה כאסימונים בדידים מתקשים במשימות עדינות.
היקף האימון, ומספר אחד שמיוחס לו בטעות
תערובת הקדם-אימון מורכבת משני חלקים. הראשון הוא נתונים שהחברה אספה בעצמה: כ-10,000 שעות הדגמה, שנאספו על שבע תצורות שונות של רובוטים ועל 68 משימות. השני הוא נתונים פתוחים קיימים — מלוא מאגר Open X-Embodiment, לצד המאגרים DROID ו-Bridge. כמה מהנתונים בדיוק נלקחו מ-OXE היא שאלה שהמאמר עצמו אינו עקבי בה: בתיאור התערובת הוא כותב 'מלוא מאגר OXE', שמכיל נתונים מ-22 רובוטים, ואילו באיור שמפרט את התערובת הוא כותב שנעשה שימוש בתת-קבוצה של המאגר, שהמחברים מכנים OXE Magic Soup, ומוסיף שכלל המאגרים הפתוחים מהווים 9.1 אחוזים מתערובת האימון. המאמר מתאר את התערובת הזאת, למיטב ידיעת מחבריו, כגדולה ביותר שנעשה בה שימוש עד אז לאימון מודל למניפולציה רובוטית. נקודה שקל להתבלבל בה: המספר 970 אלף פרקים, שמופיע לעיתים בסביבת הנושא הזה, אינו של π₀ — הוא היקף האימון של OpenVLA מתוך אותו מאגר משותף. מאמר π₀ מודד את הנתונים שלו בשעות, והמספר הזה אינו מופיע בו כלל.
קדם-אימון ואימון-המשך, כמו במודלי שפה
המתכון בן שני השלבים מקביל במכוון לזה של מודלי שפה: קדם-אימון על נתונים רחבים ומגוונים, ואחריו אימון-המשך על נתונים איכותיים למשימה מסוימת. ההסבר שהמאמר נותן לחלוקה הזאת מעשי מאוד. אימון על נתונים איכותיים בלבד אינו מלמד את המודל להתאושש מטעויות, פשוט משום שטעויות כמעט אינן מופיעות בנתונים כאלה; אימון על נתונים גסים בלבד אינו מלמד אותו לפעול ביעילות ובעמידות. השילוב הוא שנותן את שתי התכונות יחד. בהודעה שליוותה את שחרור הקוד הפתוח דיווחה החברה שבניסוייה הספיקו בין שעה אחת ל-20 שעות נתונים כדי לכוונן את המודל למשימה חדשה — בתוספת הסתייגות כללית שהתוצאה עשויה להשתנות.
מה הודגם בפועל
המשימות שהמאמר והודעת החברה מתארים כוללות קיפול כביסה, פינוי שולחן, הכנסת כלים למיקרוגל, סידור ביצים בקרטון, הרכבת קופסת קרטון ואריזת מצרכים בשקית. קיפול הכביסה הוא המקרה המעניין שבהם: ערימה מקומטת יכולה להיות מסודרת באינספור צורות, ולכן חזרה על רצף-תנועות קבוע מראש אינה פותרת אותה. החברה פרסמה סרטון לא-ערוך שבו רובוט מוציא כביסה מהמייבש, מביא אותה לשולחן ומקפל אותה לערימה. בפינוי השולחן דיווחו המפתחים על אסטרטגיות שלא תוכנתו מראש ושהמודל הראה שהוא מסוגל להן: לערום כמה צלחות יחד כדי להעביר אותן במכה אחת, או לנער שאריות מצלחת אל הפח לפני שמניחים אותה בסל.
מול מה הוא נמדד, ומה המחברים משאירים פתוח
ההשוואה במאמר היא מול OpenVLA, מודל בן שבעה מיליארד פרמטרים שכותב פעולה כאסימונים בדידים, ומול Octo, מודל קטן בן 93 מיליון פרמטרים שמשתמש בתהליך דיפוזיה. בחמש משימות-מבחן שנוקדו בציון חלקי (ביצוע מלא מזכה ב-1, חלקי בשבר), π₀ קיבל את הציון הגבוה ביותר בכולן — למשל 0.971 בגרסה הקלה של פינוי שולחן, לעומת אפס ל-OpenVLA שאומן על מלוא התערובת ו-0.043 ל-Octo. גם גרסה מוקטנת של המודל עצמו, בת 470 מיליון פרמטרים ובלי אתחול ממודל ראייה-שפה, עלתה על שני קווי-הבסיס, אך הגרסה המלאה, עם אתחול ממודל ראייה-שפה, יותר מהכפילה את ביצועיה. המחברים מסייגים בשלושה דברים: אין להם עדיין הבנה מלאה של איך להרכיב את תערובת הקדם-אימון, לא כל המשימות בהערכה עובדות באופן אמין, ולא ידוע אם ההעברה החיובית בין רובוטים תימשך גם לתחומים רחוקים יותר כמו נהיגה אוטונומית, ניווט או הליכה.