מה נלמד כאן, ומה זה בא במקומו
תכנון תנועה קלאסי מחשב מראש רצף מצבים חוקי שמעביר את הרובוט מנקודת-המוצא ליעד, ואז הבקר מריץ אותו. כאן נלמדת במקומו מדיניות: פונקציה שמקבלת את מצב הרובוט ברגע נתון ומחזירה את פקודת-המנוע הבאה, ומשתפרת מניסוי וטעייה מול תגמול. בעבודה מ-2019 על רובוט ארבע-רגלי נוסח הנימוק כך: תמרונים זריזים ודינמיים של בעלי-חיים אינם ניתנים לחיקוי בשיטות הקיימות, שנבנות ביד, ואילו למידת חיזוק היא חלופה משכנעת שדורשת מעט מאוד עבודת-אומן.
למה קשה לאמן על החומרה עצמה
אימון על רובוט אמיתי, ובמיוחד על מערכת שמאזנת את עצמה דינמית, מסובך ויקר — ולכן המחקר על רובוטים מתהלכים נשאר בעיקר בסימולציה, ורק דוגמאות מעטות ופשוטות יחסית הועברו למערכות אמיתיות. הסיבות מוחשיות: נפילות חוזרות, התנגשות של הרובוט בעצמו ובמכשולים והפעלה קופצנית של המנועים עלולות להזיק לרובוט ולסביבתו ולחייב תיקונים יקרים והתערבות ידנית. בנוסף, אלגוריתמים נפוצים דורשים מיליוני צעדי-אימון, כלומר מיליוני אינטראקציות עם העולם האמיתי — דרישה שאינה מעשית.
מי אומר לרובוט שהצליח
בסימולציה קל להגדיר את פונקציית-התגמול, כי יש גישה מלאה למצב המערכת. בעולם האמיתי, מתן ציון לשאלה עד כמה המשימה בוצעה היטב הוא בעצמו אתגר-תפיסה. סקירת-לקחים של יוליאן איברז ועמיתיו (Julian Ibarz) מ-2021 מתארת שלוש דרכי-מעקף: להוסיף חיישן שמודד את התגמול, כמו יחידת מדידה אינרציאלית (IMU) שמדדה את זווית הדלת, או לכידת-תנועה שמדדה מהירות הליכה; להסתפק בכלל-אצבע, כמו השוואת תמונות עם האחיזה ובלעדיה; או ללמוד מודל-חיזוי חזותי, שבו המטרה מוגדרת בתמונה בזמן ההרצה ולא בפונקציה מראש.
רגליים: מ-ANYmal ועד מסלול-הליכה באלפים
אחת הזירות שבהן הודגמה הגישה בפירוט היא הליכה של רובוט מתהלך בעל ארבע רגליים. ב-2019 אומנה רשת עצבית בסימולציה והועברה ל-ANYmal, מערכת ארבע-רגלית בגודל כלב בינוני; המדיניות שנלמדה עקבה במדויק ובחיסכון-אנרגטי אחר פקודות-מהירות, רצה מהר יותר משהושג בשיטות קודמות, וידעה לקום מנפילה גם בתנוחות מורכבות. עבודת-המשך מ-2022 שילבה במדיניות אחת את החישה הפנימית ואת מה שהרובוט רואה מלפניו; הבקר שנוצר נבחן בסביבות טבעיות ועירוניות לאורך כמה עונות, והשלים מסלול-הליכה בן שעה באלפים בזמן שמומלץ למטיילים.
מעבר לרגליים: קובייה הונגרית ומרוץ רחפנים
ב-2019 הראתה OpenAI שמדיניות שאומנה בסימולציה בלבד פותרת קובייה הונגרית ביד רובוטית הומנואידית. המפתח היה אקראיזציה אוטומטית של המרחב (ADR): במקום שמהנדס יקבע ידנית כמה הסימולציה תשתנה, האלגוריתם מייצר בעצמו סביבות אקראיות בקושי הולך וגובר. ב-2023 פורסמה Swift, מערכת שמשלבת למידת חיזוק עמוקה בסימולציה עם נתונים מהעולם הפיזי; היא התמודדה במרוצי-רחפנים מגוף-ראשון מול שלושה אלופים אנושיים, ובהם אלופי-העולם של שתי ליגות בינלאומיות, ניצחה כמה מרוצים מול כל אחד מהם וקבעה את זמן-המרוץ המהיר ביותר שנרשם.
מה עדיין פתוח, ומה זה לא מחליף
קושי שסקירת-הלקחים מדגישה במיוחד הוא היכולת של הרובוט להמשיך לאסוף נתונים בלי אדם לצידו. רוב ניסויי-הלמידה עד היום נערכו על רובוט אחד בפיקוח צמוד של מפעיל אחד, שמסדר מחדש את הזירה, עוצר במצב מסוכן ומאתחל אחרי כישלון. הסקירה מפרידה בין התמדה עצמית, שהרובוט לא יזיק לעצמו תוך כדי האימון, לבין התמדת-משימה, שיוכל להמשיך לבצע אותה.
נותר גם פער-המציאות: מדיניות שנלמדה בסימולציה בדרך-כלל אינה עובדת היטב על הרובוט האמיתי, וזה הקושי שבמעבר מסימולציה למציאות (Sim-to-Real). לפי אותה סקירה, אחיזה רובוטית נותרה אחת הבעיות הפתוחות המשמעותיות ברובוטיקה: היא מחייבת מגע עם עצמים שלא נראו קודם ובקרה חזותית שמגיבה לדינמיקה בלתי-צפויה. שלושת הכלים כאן אינם מחליפים זה את זה: ZMP קובע היכן חייבת להיות נקודת-האיזון ברגע נתון, מבנה Behavior Tree קובע איזו תת-משימה תרוץ עכשיו, והמדיניות הנלמדת קובעת את פקודת-המנוע הבאה.