π₀ — מודל ראייה-שפה-פעולה בהתאמת-זרימה, 3.3 מיליארד פרמטרים

רובוטיקה

הגדרה

π₀ הוא מודל יסוד לרובוטים שפרסמה החברה Physical Intelligence באוקטובר 2024, ומחבר מודל ראייה-שפה מאומן-מראש למנגנון שפולט פקודות תנועה רציפות בתדר גבוה.

מה הערך הזה מכסה, ומה כתוב במקום אחר

π₀ (בהגייה pi-zero, ונכתב גם π0) הוא מודל יסוד לרובוטים שפורסם ב-31 באוקטובר 2024, במאמר שמכנה מודלים מהסוג הזה מדיניות כללית לרובוט. הערך הזה עוסק במאמר ובמודל עצמם: מה הם מציעים טכנית, על אילו נתונים המודל אומן, ומה נמדד בו בפועל. סיפור החברה שמאחוריו — מתי נוסדה, מי מימן אותה ואילו דורות יצאו אחריו — נמצא בערך הנפרד על Physical Intelligence, ואינו נשנה כאן. ההסבר הכללי של מודל ראייה-שפה-פעולה (VLA) נמצא אף הוא בערך משלו. הודעת החברה שליוותה את הפרסום מנסחת את המוטיבציה דרך פרדוקס מורבק: ניצחון במשחק שחמט או גילוי תרופה חדשה הם בעיות קלות יחסית לבינה מלאכותית, ואילו קיפול חולצה או פינוי שולחן דורשים לפתור כמה מבעיות ההנדסה הקשות שהוצבו אי-פעם.

הארכיטקטורה: מודל ראייה-שפה, ומעליו מומחה-פעולה

השלד של π₀ הוא PaliGemma, מודל ראייה-שפה פתוח בן שלושה מיליארד פרמטרים, שאליו נוספו כ-300 מיליון פרמטרים של רכיב שהמאמר מכנה מומחה-פעולה — ובסך-הכול כ-3.3 מיליארד. חלוקת התפקידים ברורה: השלד מביא ידע סמנטי שנלמד בקנה-מידה אינטרנטי, ומומחה-הפעולה הופך אותו לפקודות תנועה. החיבור בין השניים נעשה בהתאמת-זרימה (flow matching), שיטה שהמאמר מתאר כווריאנט של דיפוזיה, והיא שמאפשרת למודל לשלוט ברובוטים בתדר של עד 50 פקודות בשנייה. כדאי לדייק מה נפלט ומתי: הרצף אינו נבנה מחדש 50 פעמים בשנייה. המודל פולט בכל פעם רצף שלם של 50 פעולות עתידיות, מריץ ממנו 25 ורק אז פונה לרצף הבא — כלומר חישוב אחד כל חצי שנייה בערך, שמזין בקרה בתדר גבוה. לפי המאמר, זו בדיוק הנקודה שבה מודלים קודמים שכתבו את הפעולה כאסימונים בדידים מתקשים במשימות עדינות.

היקף האימון, ומספר אחד שמיוחס לו בטעות

תערובת הקדם-אימון מורכבת משני חלקים. הראשון הוא נתונים שהחברה אספה בעצמה: כ-10,000 שעות הדגמה, שנאספו על שבע תצורות שונות של רובוטים ועל 68 משימות. השני הוא נתונים פתוחים קיימים — מלוא מאגר Open X-Embodiment, לצד המאגרים DROID ו-Bridge. כמה מהנתונים בדיוק נלקחו מ-OXE היא שאלה שהמאמר עצמו אינו עקבי בה: בתיאור התערובת הוא כותב 'מלוא מאגר OXE', שמכיל נתונים מ-22 רובוטים, ואילו באיור שמפרט את התערובת הוא כותב שנעשה שימוש בתת-קבוצה של המאגר, שהמחברים מכנים OXE Magic Soup, ומוסיף שכלל המאגרים הפתוחים מהווים 9.1 אחוזים מתערובת האימון. המאמר מתאר את התערובת הזאת, למיטב ידיעת מחבריו, כגדולה ביותר שנעשה בה שימוש עד אז לאימון מודל למניפולציה רובוטית. נקודה שקל להתבלבל בה: המספר 970 אלף פרקים, שמופיע לעיתים בסביבת הנושא הזה, אינו של π₀ — הוא היקף האימון של OpenVLA מתוך אותו מאגר משותף. מאמר π₀ מודד את הנתונים שלו בשעות, והמספר הזה אינו מופיע בו כלל.

קדם-אימון ואימון-המשך, כמו במודלי שפה

המתכון בן שני השלבים מקביל במכוון לזה של מודלי שפה: קדם-אימון על נתונים רחבים ומגוונים, ואחריו אימון-המשך על נתונים איכותיים למשימה מסוימת. ההסבר שהמאמר נותן לחלוקה הזאת מעשי מאוד. אימון על נתונים איכותיים בלבד אינו מלמד את המודל להתאושש מטעויות, פשוט משום שטעויות כמעט אינן מופיעות בנתונים כאלה; אימון על נתונים גסים בלבד אינו מלמד אותו לפעול ביעילות ובעמידות. השילוב הוא שנותן את שתי התכונות יחד. בהודעה שליוותה את שחרור הקוד הפתוח דיווחה החברה שבניסוייה הספיקו בין שעה אחת ל-20 שעות נתונים כדי לכוונן את המודל למשימה חדשה — בתוספת הסתייגות כללית שהתוצאה עשויה להשתנות.

מה הודגם בפועל

המשימות שהמאמר והודעת החברה מתארים כוללות קיפול כביסה, פינוי שולחן, הכנסת כלים למיקרוגל, סידור ביצים בקרטון, הרכבת קופסת קרטון ואריזת מצרכים בשקית. קיפול הכביסה הוא המקרה המעניין שבהם: ערימה מקומטת יכולה להיות מסודרת באינספור צורות, ולכן חזרה על רצף-תנועות קבוע מראש אינה פותרת אותה. החברה פרסמה סרטון לא-ערוך שבו רובוט מוציא כביסה מהמייבש, מביא אותה לשולחן ומקפל אותה לערימה. בפינוי השולחן דיווחו המפתחים על אסטרטגיות שלא תוכנתו מראש ושהמודל הראה שהוא מסוגל להן: לערום כמה צלחות יחד כדי להעביר אותן במכה אחת, או לנער שאריות מצלחת אל הפח לפני שמניחים אותה בסל.

מול מה הוא נמדד, ומה המחברים משאירים פתוח

ההשוואה במאמר היא מול OpenVLA, מודל בן שבעה מיליארד פרמטרים שכותב פעולה כאסימונים בדידים, ומול Octo, מודל קטן בן 93 מיליון פרמטרים שמשתמש בתהליך דיפוזיה. בחמש משימות-מבחן שנוקדו בציון חלקי (ביצוע מלא מזכה ב-1, חלקי בשבר), π₀ קיבל את הציון הגבוה ביותר בכולן — למשל 0.971 בגרסה הקלה של פינוי שולחן, לעומת אפס ל-OpenVLA שאומן על מלוא התערובת ו-0.043 ל-Octo. גם גרסה מוקטנת של המודל עצמו, בת 470 מיליון פרמטרים ובלי אתחול ממודל ראייה-שפה, עלתה על שני קווי-הבסיס, אך הגרסה המלאה, עם אתחול ממודל ראייה-שפה, יותר מהכפילה את ביצועיה. המחברים מסייגים בשלושה דברים: אין להם עדיין הבנה מלאה של איך להרכיב את תערובת הקדם-אימון, לא כל המשימות בהערכה עובדות באופן אמין, ולא ידוע אם ההעברה החיובית בין רובוטים תימשך גם לתחומים רחוקים יותר כמו נהיגה אוטונומית, ניווט או הליכה.

שאלות נפוצות ❓

במה π₀ שונה מ-OpenVLA?

שניהם מודלי ראייה-שפה-פעולה, אבל הם כותבים את הפעולה אחרת. OpenVLA מייצג פעולה כאסימונים בדידים, כמו מילים; π₀ מייצר רצף-פעולות רציף בהתאמת-זרימה, ולכן יכול לשלוט ברובוט בתדר של עד 50 פקודות בשנייה. במבחנים של מאמר π₀ עצמו, הגרסה של OpenVLA שאומנה על מלוא תערובת הנתונים קיבלה אפס בכל חמש משימות-המבחן; גרסה שאומנה רק על משימות ה-UR5e הגיעה ל-0.343 במשימה הקלה שבהן. המחברים מסבירים זאת בכך שהארכיטקטורה של OpenVLA אינה תומכת ברצפי-פעולה.

מה זו התאמת-זרימה, ולמה היא נחוצה כאן?

מודל ראייה-שפה יודע לפלוט אסימונים בדידים, ומניפולציה עדינה דורשת פקודות רציפות בתדר גבוה. התאמת-זרימה, שהמאמר מתאר כווריאנט של דיפוזיה, מייצרת רצף פעולות רציף במקום סדרת אסימונים — וזה מה שמאפשר עד 50 פקודות בשנייה. זו אותה משפחת שיטות שעומדת מאחורי Diffusion Policy, רק בתוך מודל שיש לו גם ידע-עולם מקדם-אימון.

אפשר להוריד ולהריץ את π₀?

כן. ב-4 בפברואר 2025 שחררה Physical Intelligence את הקוד והמשקלות במאגר שהיא עצמה מגדירה כניסיוני, בשם openpi, לצד נקודות-שמירה מכוונות לפלטפורמות נפוצות כמו ALOHA ו-DROID. החברה מסייגת במפורש שהמודל פותח עבור הרובוטים שלה עצמה, ושאינה מצפה שכל ניסיון להתאים אותו לפלטפורמה אחרת יצליח. במקביל הוכנה גם גרסת PyTorch בידי HuggingFace.

על כמה נתונים π₀ אומן?

לפי המאמר: כ-10,000 שעות הדגמה שנאספו על שבע תצורות-רובוט ועל 68 משימות, ובנוסף נתונים פתוחים מ-Open X-Embodiment, מ-DROID ומ-Bridge. על היקף החלק הפתוח המאמר אינו עקבי: במקום אחד הוא כותב 'מלוא מאגר OXE' ובמקום אחר תת-קבוצה שלו בשם OXE Magic Soup, לצד הנתון שכלל המאגרים הפתוחים הם 9.1 אחוזים מהתערובת. המספר 970 אלף פרקים אינו שייך לכאן כלל — זהו היקף האימון של OpenVLA.

מה המודל עדיין לא יודע לעשות?

המחברים עצמם מונים שלוש מגבלות בסוף המאמר: אין עדיין הבנה של הרכב תערובת הקדם-אימון הנכון, לא כל המשימות בהערכה פועלות באופן אמין, ולא ברור אם ההעברה החיובית בין גופים רובוטיים שונים תימשך גם לתחומים רחוקים כמו נהיגה אוטונומית, ניווט או הליכה על רגליים.