מה היא עושה
מדיניות רובוטית רגילה מקבלת תצפית ומחזירה פעולה. Diffusion Policy אינה מחזירה פעולה אלא מזקקת אותה: היא מתחילה מרעש אקראי ומבצעת עליו סדרת צעדי ניקוי, כשבכל צעד היא מעריכה לאן צריך לזוז בתוך מרחב הפעולות כדי להתקרב לפעולה סבירה. התהליך כולו מותנה במה שהמצלמה רואה באותו רגע. זהו בדיוק המנגנון של מודל דיפוזיה ליצירת תמונות, אלא שהתוצר אינו תמונה אלא רצף של פקודות תנועה קדימה בזמן. השיטה פורסמה ב-2023 בידי חוקרים מאוניברסיטת קולומביה, מ-Toyota Research Institute, מ-MIT ומאוניברסיטת סטנפורד.
הבעיה שהיא פותרת: כשיש יותר מדרך נכונה אחת
בלמידה מהדגמות אנושיות יש לעיתים קרובות יותר מפתרון נכון אחד: אפשר לעקוף חפץ משמאל או מימין, ושתי ההדגמות תקינות. המאמר בוחן את זה במשימת דחיפה של גוש בצורת האות T, ומראה ששיטות קודמות נכשלות בה בשתי דרכים הפוכות: חלקן — LSTM-GMM ו-IBC — נוטות לצד אחד ומתעלמות מהאפשרות השנייה, ואילו BET אינה מצליחה להתחייב לצד אחד כלל. מה שמאפשר ל-Diffusion Policy לבחור צד ולהתמיד בו הוא לא עצם ייצוג ההתפלגות, אלא שהיא מנבאת רצף פעולות שלם בבת-אחת: כשכל פעולה מנובאת בנפרד, פעולות עוקבות עלולות להישאב מצדדים שונים, והתוצאה היא תנועה קופצנית שמתחלפת בין שני מסלולים תקינים. המאמר מכנה את התכונה הזאת עקביות-פעולה לאורך זמן.
שלוש תרומות טכניות, כל אחת לבעיה אחרת
המחברים מדגישים שלוש תרומות טכניות, וכל אחת פותרת בעיה אחרת. הראשונה היא בקרת אופק נסוג: המדיניות מנבאת רצף פעולות שלם, מבצעת רק חלק ממנו, ואז מנבאת מחדש — מה שמשפר את חלקות התנועה ואת יכולת התגובה. השנייה היא התניה חזותית — התמונה מקודדת פעם אחת לכל הסקה, ולא מחדש בכל צעד ניקוי; זו התרומה היחידה שהמאמר זוקף לה במפורש את היכולת להסיק בזמן אמת, כי היא מורידה את עלות החישוב דרמטית. השלישית היא רשת דיפוזיה מבוססת טרנספורמר לסדרות זמן, שנועדה להתמודד עם נטייה של רשתות קונבולוציה להחליק פעולות שמשתנות מהר, למשל פקודות מהירות.
המספר: שיפור ממוצע של 46.9 אחוזים
בגרסת המאמר שהתפרסמה בכתב העת IJRR נבחנה השיטה על 15 משימות מארבעה מבחני ייחוס שונים, בסימולציה ובעולם האמיתי, על מערכות שמרחב הפעולה שלהן נע בין שתי דרגות חופש לשש. השיפור הממוצע מול השיטות המובילות שקדמו לה עמד על 46.9 אחוזים. כדאי לדייק מה המספר הזה אומר: המאמר מציג אותו כשיפור ממוצע על פני מבחנים שונים, לא כשיעור הצלחה. בגרסה הראשונה, שהוצגה בכנס RSS ב-2023, נמדדו 12 משימות ואותו שיפור ממוצע עצמו.
המחיר: כמה זמן לוקח לנקות רעש
החיסרון המובן מאליו של דיפוזיה הוא שכל פעולה דורשת כמה מעברים דרך הרשת, וזה יקר עבור בקרה בלולאה סגורה. הפתרון שהמאמר מתאר הוא הפרדה בין מספר צעדי הניקוי באימון לבין מספרם בהסקה: 100 באימון, 10 בהסקה — מה שהניב השהיה של עשירית שנייה על כרטיס מסך מסוג Nvidia 3080 בניסויים בעולם האמיתי. ממצא נוסף שהמחברים עצמם מציינים כמפתיע: מרחב פעולות של מיקום נתן תוצאות טובות יותר ממרחב פעולות של מהירות, בניגוד לרוב עבודות הלמידה מהדגמה באותה תקופה.
המקום שלה היום: אמת המידה שמולה נמדדים אחרים
Diffusion Policy הפכה לקו ההשוואה הקבוע שמולו נמדדים מודלי ראייה-שפה-פעולה (VLA). מאמר OpenVLA מדווח שהוא עלה עליה ב-20.4 אחוזים, ומדגיש את ההבדל המהותי: היא מאומנת מאפס על משימת היעד בלבד, בלי ידע עולם מוקדם. אבל גוף אותו מאמר מסייג את המספר: במשימות צרות עם הוראה אחת קבועה Diffusion Policy שקולה למודלים הכלליים או עולה עליהם, וה-OpenVLA מנצח דווקא במשימות מגוונות שכוללות כמה עצמים והוראות שונות; ובמשימות צרות ותובעניות-דיוק, כותבי OpenVLA מציינים, Diffusion Policy עדיין מייצרת מסלולים חלקים ומדויקים יותר. מאמר π₀ כולל אותה בהשוואות הכיוונון שלו, ומוסיף הערה מעניינת — מבין השיטות הקודמות, החזקות ביותר היו דווקא אלה שאומנו כולן מאפס על משימת היעד, מה שמלמד שניצול קדם-אימון בתחומים האלה עדיין קשה. יש גם קרבה ארכיטקטונית, ומאמר π₀ מודה בה במפורש: הוא בוחר בהתאמת זרימה, שהוא מתאר כווריאנט של דיפוזיה, וכותב שגישתו דומה לשורת עבודות אחרונות על מודלי דיפוזיה ליצירת פעולה — ובהן Diffusion Policy עצמה. אותו מאמר אף חוזר במפורש על אחד מאותם נימוקים: הוא כותב שהתאמת-הזרימה מעניקה למודל שלו יכולת ייצוג רב-אפשרויות לצד דיוק גבוה — כלומר גם π₀ מנמק, לפחות בחלקו, בריבוי-אפשרויות, בדיוק כמו Diffusion Policy. הנימוק שהוא מוסיף משלו ושאינו מופיע כך אצל קודמתה הוא הצורך לייצג רצפי-פעולה רציפים בתדר גבוה.