Diffusion Policy — שיטת-חיקוי מבוססת-דיפוזיה; אמת-המידה של מודלי VLA

רובוטיקה

הגדרה

Diffusion Policy היא שיטה ללמידת בקרה רובוטית מהדגמות, שפורסמה ב-2023 ומייצרת רצף פעולות בניקוי רעש הדרגתי — אותו מנגנון שמאחורי מודלי יצירת התמונות.

מה היא עושה

מדיניות רובוטית רגילה מקבלת תצפית ומחזירה פעולה. Diffusion Policy אינה מחזירה פעולה אלא מזקקת אותה: היא מתחילה מרעש אקראי ומבצעת עליו סדרת צעדי ניקוי, כשבכל צעד היא מעריכה לאן צריך לזוז בתוך מרחב הפעולות כדי להתקרב לפעולה סבירה. התהליך כולו מותנה במה שהמצלמה רואה באותו רגע. זהו בדיוק המנגנון של מודל דיפוזיה ליצירת תמונות, אלא שהתוצר אינו תמונה אלא רצף של פקודות תנועה קדימה בזמן. השיטה פורסמה ב-2023 בידי חוקרים מאוניברסיטת קולומביה, מ-Toyota Research Institute, מ-MIT ומאוניברסיטת סטנפורד.

הבעיה שהיא פותרת: כשיש יותר מדרך נכונה אחת

בלמידה מהדגמות אנושיות יש לעיתים קרובות יותר מפתרון נכון אחד: אפשר לעקוף חפץ משמאל או מימין, ושתי ההדגמות תקינות. המאמר בוחן את זה במשימת דחיפה של גוש בצורת האות T, ומראה ששיטות קודמות נכשלות בה בשתי דרכים הפוכות: חלקן — LSTM-GMM ו-IBC — נוטות לצד אחד ומתעלמות מהאפשרות השנייה, ואילו BET אינה מצליחה להתחייב לצד אחד כלל. מה שמאפשר ל-Diffusion Policy לבחור צד ולהתמיד בו הוא לא עצם ייצוג ההתפלגות, אלא שהיא מנבאת רצף פעולות שלם בבת-אחת: כשכל פעולה מנובאת בנפרד, פעולות עוקבות עלולות להישאב מצדדים שונים, והתוצאה היא תנועה קופצנית שמתחלפת בין שני מסלולים תקינים. המאמר מכנה את התכונה הזאת עקביות-פעולה לאורך זמן.

שלוש תרומות טכניות, כל אחת לבעיה אחרת

המחברים מדגישים שלוש תרומות טכניות, וכל אחת פותרת בעיה אחרת. הראשונה היא בקרת אופק נסוג: המדיניות מנבאת רצף פעולות שלם, מבצעת רק חלק ממנו, ואז מנבאת מחדש — מה שמשפר את חלקות התנועה ואת יכולת התגובה. השנייה היא התניה חזותית — התמונה מקודדת פעם אחת לכל הסקה, ולא מחדש בכל צעד ניקוי; זו התרומה היחידה שהמאמר זוקף לה במפורש את היכולת להסיק בזמן אמת, כי היא מורידה את עלות החישוב דרמטית. השלישית היא רשת דיפוזיה מבוססת טרנספורמר לסדרות זמן, שנועדה להתמודד עם נטייה של רשתות קונבולוציה להחליק פעולות שמשתנות מהר, למשל פקודות מהירות.

המספר: שיפור ממוצע של 46.9 אחוזים

בגרסת המאמר שהתפרסמה בכתב העת IJRR נבחנה השיטה על 15 משימות מארבעה מבחני ייחוס שונים, בסימולציה ובעולם האמיתי, על מערכות שמרחב הפעולה שלהן נע בין שתי דרגות חופש לשש. השיפור הממוצע מול השיטות המובילות שקדמו לה עמד על 46.9 אחוזים. כדאי לדייק מה המספר הזה אומר: המאמר מציג אותו כשיפור ממוצע על פני מבחנים שונים, לא כשיעור הצלחה. בגרסה הראשונה, שהוצגה בכנס RSS ב-2023, נמדדו 12 משימות ואותו שיפור ממוצע עצמו.

המחיר: כמה זמן לוקח לנקות רעש

החיסרון המובן מאליו של דיפוזיה הוא שכל פעולה דורשת כמה מעברים דרך הרשת, וזה יקר עבור בקרה בלולאה סגורה. הפתרון שהמאמר מתאר הוא הפרדה בין מספר צעדי הניקוי באימון לבין מספרם בהסקה: 100 באימון, 10 בהסקה — מה שהניב השהיה של עשירית שנייה על כרטיס מסך מסוג Nvidia 3080 בניסויים בעולם האמיתי. ממצא נוסף שהמחברים עצמם מציינים כמפתיע: מרחב פעולות של מיקום נתן תוצאות טובות יותר ממרחב פעולות של מהירות, בניגוד לרוב עבודות הלמידה מהדגמה באותה תקופה.

המקום שלה היום: אמת המידה שמולה נמדדים אחרים

Diffusion Policy הפכה לקו ההשוואה הקבוע שמולו נמדדים מודלי ראייה-שפה-פעולה (VLA). מאמר OpenVLA מדווח שהוא עלה עליה ב-20.4 אחוזים, ומדגיש את ההבדל המהותי: היא מאומנת מאפס על משימת היעד בלבד, בלי ידע עולם מוקדם. אבל גוף אותו מאמר מסייג את המספר: במשימות צרות עם הוראה אחת קבועה Diffusion Policy שקולה למודלים הכלליים או עולה עליהם, וה-OpenVLA מנצח דווקא במשימות מגוונות שכוללות כמה עצמים והוראות שונות; ובמשימות צרות ותובעניות-דיוק, כותבי OpenVLA מציינים, Diffusion Policy עדיין מייצרת מסלולים חלקים ומדויקים יותר. מאמר π₀ כולל אותה בהשוואות הכיוונון שלו, ומוסיף הערה מעניינת — מבין השיטות הקודמות, החזקות ביותר היו דווקא אלה שאומנו כולן מאפס על משימת היעד, מה שמלמד שניצול קדם-אימון בתחומים האלה עדיין קשה. יש גם קרבה ארכיטקטונית, ומאמר π₀ מודה בה במפורש: הוא בוחר בהתאמת זרימה, שהוא מתאר כווריאנט של דיפוזיה, וכותב שגישתו דומה לשורת עבודות אחרונות על מודלי דיפוזיה ליצירת פעולה — ובהן Diffusion Policy עצמה. אותו מאמר אף חוזר במפורש על אחד מאותם נימוקים: הוא כותב שהתאמת-הזרימה מעניקה למודל שלו יכולת ייצוג רב-אפשרויות לצד דיוק גבוה — כלומר גם π₀ מנמק, לפחות בחלקו, בריבוי-אפשרויות, בדיוק כמו Diffusion Policy. הנימוק שהוא מוסיף משלו ושאינו מופיע כך אצל קודמתה הוא הצורך לייצג רצפי-פעולה רציפים בתדר גבוה.

שאלות נפוצות ❓

מה הקשר בין השיטה למודלים שמייצרים תמונות?

המנגנון זהה. מודל דיפוזיה מתחיל מרעש ומנקה אותו בהדרגה עד שמתקבלת תמונה; כאן אותו תהליך מיושם על מרחב הפעולות של הרובוט, והתוצר הוא רצף פקודות תנועה במקום פיקסלים. גם השם וגם המתמטיקה נלקחו משם — המאמר מנסח את המדיניות כתהליך דיפוזיה מנקה-רעש מותנה על מרחב הפעולות.

למה זה עדיף על מדיניות שפשוט מנבאת את הפעולה הבאה?

שלוש סיבות שהמאמר מונה בעצמו: היכולת לייצג התפלגות פעולות שיש בה כמה אפשרויות תקינות, ולא רק אחת; התאמה למרחבי פעולה בעלי ממדים רבים, כלומר לרצף פעולות שלם ולא לצעד בודד; ויציבות אימון גבוהה, שדורשת מעט כיוונון ידני לכל משימה. ההתמדה בצד שנבחר נובעת מהניבוי של רצף שלם בבת-אחת, ולא מייצוג ההתפלגות כשלעצמו — ראו הסעיף על ריבוי הדרכים הנכונות.

זה לא איטי מדי בשביל רובוט?

זו אכן הנקודה הרגישה, והמאמר מטפל בה. באמצעות שיטה שמפרידה בין מספר הצעדים באימון למספרם בהסקה הם הריצו 100 צעדים באימון ורק 10 בהסקה, והגיעו להשהיה של עשירית שנייה על כרטיס Nvidia 3080. במערכת האמיתית שלהם המדיניות פלטה פקודות בקצב של 10 פעמים בשנייה.

מה בדיוק אומר השיפור של 46.9 אחוזים?

זהו שיפור ממוצע מול השיטות המובילות שקדמו לה, על פני 15 משימות מארבעה מבחני ייחוס בגרסת כתב העת (12 משימות בגרסת הכנס משנת 2023). זה אינו שיעור ההצלחה של השיטה, אלא מדד השוואתי בין שיטות על אותם מבחנים.

היא עדיין רלוונטית מול מודלי ראייה-שפה-פעולה?

כן, בעיקר כאמת מידה. OpenVLA מדווח שעלה עליה ב-20.4 אחוזים, אך גוף אותו מאמר מסייג שבמשימות צרות עם הוראה אחת היא שקולה לו או טובה ממנו, ושהיא אומנה מאפס בלי ידע עולם; מאמר π₀ מצא שדווקא השיטות שאומנו כולן מאפס על משימת היעד היו החזקות מבין הקודמות לו. מעבר לכך, הרעיון עצמו המשיך הלאה: ארכיטקטורות חדשות משתמשות בדיפוזיה או בווריאנט שלה כדי לפלוט פעולות רציפות.