הבעיה שהטכניקה פותרת: פער בין הדמיה למציאות
אקראיזציה של המרחב (Domain Randomization) היא טכניקת-אימון שמשנה בכוונה ובאקראי פרמטרים בסימולציה — צבעים, תאורה, חיכוך, מסות ועוד — כדי שמדיניות שנלמדה רק בהדמיה תתפקד גם בעולם האמיתי. הרעיון פורסם לראשונה ב-2017 בידי חוקרים מ-OpenAI ומאוניברסיטת קליפורניה בברקלי: במקום לאמן מודל על סביבת-הדמיה יחידה, הם שינו באקראי את פרמטרי הסימולטור כדי לחשוף את המודל למגוון רחב של סביבות בזמן האימון. אם השונות בהדמיה גדולה מספיק, העולם האמיתי נראה למודל כמו עוד וריאציה, ולא כמשהו זר.
ההוכחה הראשונה: לזהות עצם עד 1.5 סנטימטר
במאמר המקורי אומנה רשת-זיהוי אך ורק על תמונות מדומות עם טקסטורות, תאורה ורקעים אקראיים, בלי אף תמונת-אמת אחת. המערכת איתרה עצמים אמיתיים בטעות ממוצעת של כ-1.5 סנטימטרים, ובמשימת-אחיזה בסביבה עמוסה הצליחה ב-38 מתוך 40 ניסיונות. החוקרים מכנים זאת ההעברה המוצלחת הראשונה של רשת שאומנה רק על תמונות RGB מדומות, בלי אימון-מקדים על תמונות אמיתיות, לבקרת רובוט בעולם האמיתי.
הגרסה האוטומטית: הקושי גדל בעצמו
בשיטה הרגילה מהנדס קובע מראש כמה הסימולציה תשתנה — התפלגות קבועה. ב-2019 הציגה OpenAI גרסה אוטומטית, ADR: במקום טווח קבוע, אלגוריתם מרחיב בעצמו את טווח-האקראיות בכל פעם שהמדיניות מצליחה מעבר לסף מסוים, ומצמצם אותו כשהיא נכשלת מתחת לסף אחר. כך הסביבה נעשית קשה יותר בהדרגה, בקצב שתלוי בביצועי המודל עצמו ולא בניחוש אנושי מראש. שנה קודם לכן כבר נעשה שימוש באקראיזציה רגילה — חיכוך ומראה של עצם — כדי לאמן את אותה יד רובוטית בסימולציה בלבד.
המבחן: קובייה הונגרית ביד רובוטית
ADR הוכחה על יד רובוטית הומנואידית שפתרה קובייה הונגרית אחרי אימון בסימולציה בלבד — צבירה של כ-13 אלף שנות-ניסיון מדומות. על הרובוט הפיזי היא פתרה קובייה שדורשת 15 סיבובי-פאה ב-60 אחוזים מהניסיונות, וקובייה שדורשת 26 סיבובים, הקשה משמעותית, ב-20 אחוזים מהניסיונות. אלה שני תרגילים בדרגת-קושי שונה, לא אותה משימה שנמדדה פעמיים, ואין קשר בין המספרים האלה לנתון 32 אחוזים ל-62 אחוזים שמופיע בערך RT-2, שנמדד על משימה אחרת לגמרי.
למה זה כל-כך נפוץ ברובוטיקה של היום
כמעט כל מדיניות-רובוט שנלמדת היום מתחילה בסימולציה, כי אימון על חומרה אמיתית איטי, יקר ומסוכן, ואילו בסימולציה אפשר להריץ אלפי ניסיונות במקביל, מהר מזמן-אמת. אקראיזציה של המרחב היא אחד הכלים המרכזיים שגישרו על הפער הזה, לצד גישות משלימות שמתמודדות איתו בדרך אחרת — למשל רשת-מפעילים שנלמדת ישירות מנתוני-חומרה אמיתיים, ולא מהנחה על פיזיקת-הסימולציה. סקירה מ-2020 על העברה מסימולציה למציאות ברובוטיקה מונה את האקראיזציה כאחת משיטות-הגישור הנפוצות ביותר בתחום כולו, לא רק במעבדה אחת. הערך למידת חיזוק לבקרת רובוטים מתאר הרחבה כזאת בפירוט, כולל את השימוש הספציפי ב-ADR לפתרון הקובייה ההונגרית.
מה עדיין לא פתור
אקראיזציה אינה תרופת-פלא. סימולציה טובה ככל שתהיה עדיין לא מדגמנת במלואם מגע עדין, חומרים רכים או תאורה בלתי-צפויה, וטווח-אקראיזציה גדול מדי עלול דווקא להקשות על הלמידה עד כדי כישלון — יותר מדי שונות בין ניסיון לניסיון, ולא מספיק דפוס-קבוע ללמוד ממנו. הבחירה כמה ואיך לשנות באקראי נשארת, גם בגרסה האוטומטית, תלוית-משימה: יד רובוטית שמסובבת קובייה זקוקה לטווח-אקראיזציה שונה לגמרי מרובוט מתהלך שחוצה שטח משובש. וזו הסיבה שהתחום ממשיך לחפש דרכים לצמצם את התלות בסימולציה עצמה, ולא רק להרחיב את הטווח שהיא מכסה.