הרעיון: ללמוד מהדגמה, לא מכללים מתוכנתים
למידת חיקוי (Imitation Learning) היא פרדיגמה בלמידת-מכונה, הקרובה ללמידת חיזוק, שבה סוכן לומד לבצע משימה מתוך תצפית על הדגמות של מומחה — במקום מקבלת חוקי-תכנות מפורשים מראש. ההדגמות מוקלטות כזוגות של מצב ופעולה: מה המומחה ראה או חש באותו רגע (המצב), ומה הוא עשה בתגובה (הפעולה). הסוכן לומד פונקציה שממפה מצב לפעולה מתוך אוסף גדול של זוגות כאלה — בלי שאף אחד כתב לו כלל מפורש בסגנון "אם קורה X, עשה Y". השם השני שבו התחום מכונה, "למידת-שוליה" (Apprenticeship Learning), ממחיש את הרעיון: כמו שוליה שלומד מלאכה מצפייה בבעל-מקצוע ולא מספר-חוקים.
שיבוט-התנהגות: הגישה הפשוטה ביותר
הגישה הבסיסית ביותר, שיבוט-התנהגות (Behavioral Cloning), מתייחסת לבעיה כאל למידה מונחית רגילה: המצבים הם קלט, פעולות-המומחה הן התיוג הנכון, ואימון-המודל מנסה פשוט לחזות את פעולת-המומחה מתוך המצב, בלי מעורבות נוספת של הסביבה או של תגמול. זו הדרך המהירה והזולה ביותר לבנות סוכן שמחקה מומחה, מפני שהיא לא דורשת סימולטור פעיל או אינטראקציה חוזרת עם הסביבה בזמן-האימון — רק אוסף-הדגמות קבוע מראש, שנאסף פעם אחת ונשאר קבוע לכל אורך תהליך-הלמידה.
הבעיה: סטייה-התפלגותית שמצטברת
שיבוט-התנהגות נתקל בבעיה עקבית: המומחה כמעט אף פעם לא טועה, ולכן ההדגמות שלו כמעט אינן מכסות מצבים של טעות-בדרך. ברגע שהסוכן-הלומד סוטה מעט מהמסלול שהמומחה הדגים, הוא מוצא את עצמו במצב שמעולם לא נצפה באימון — ואינו יודע איך להגיב, מה שמגדיל את הסטייה עוד יותר. דוגמה מוקדמת ומוכרת היא ALVINN, רכב-עצמי-נהיגה שפיתחה אוניברסיטת קרנגי-מלון ב-1988–1989: הרשת שלו אומנה על נהיגת-אדם רגילה, אך מעולם לא ראתה איך חוזרים אל הכביש אחרי סטייה ממנו, כי נהגים אנושיים כמעט לא סוטים.
DAgger: לתקן את הבעיה באמצעות משוב חוזר
ב-2011 הציעו סטפאן רוס, ג'פרי גורדון ודרו בגנל אלגוריתם בשם DAgger (Dataset Aggregation), שמטפל בסטייה-ההתפלגותית באופן שונה: במקום להסתמך רק על הדגמות-המומחה המקוריות, הוא מריץ את הסוכן-הלומד בעצמו, אוסף את המצבים החדשים שהוא נתקל בהם, מבקש מהמומחה לתייג גם אותם, ומוסיף אותם לאוסף-האימון לפני הסבב הבא. כך הסוכן לומד גם איך להתאושש ממצבים שהוא עצמו גרם להם לקרות בגלל טעויותיו-שלו, לא רק לחקות את מה שהמומחה עשה במסלול המקורי והנקי שהוא הדגים.
למידת-חיזוק-הפוכה: ללמוד את המטרה, לא רק את הפעולה
גישה חלופית, למידת-חיזוק-הפוכה (Inverse Reinforcement Learning), לא מנסה לחקות את פעולות-המומחה ישירות אלא ללמוד תחילה איזו פונקציית-תגמול מסבירה את ההתנהגות שלו — ולהשתמש בלמידת-חיזוק רגילה כדי למצוא מדיניות שממקסמת את אותו תגמול. היתרון: סוכן שלמד "למה" המומחה נהג כפי שנהג, לא רק "מה" הוא עשה, יכול להתמודד טוב יותר עם מצבים חדשים שהמומחה מעולם לא הדגים, מפני שהוא מבין את המטרה הכללית ולא רק שינן תגובה נקודתית אחת לכל מצב שראה.
יישומים: מנהיגה-עצמית ועד אקרובטיקת-מסוקים
הדוגמה המוקדמת ביותר, ALVINN, כבר הראתה שרכב יכול ללמוד לשמור על נתיב מהדגמות-נהיגה אנושיות בלבד. הישג בולט הרבה יותר הגיע ברובוטיקה: פייטר אבביל, אדם קוטס ואנדרו נג פיתחו מסוק-אוטונומי שלמד מהדגמות של טייס-מומחה לבצע לראשונה תמרוני-אקרובטיקה כמו סלטות-במקום, גלגולים, לולאות ואפילו נחיתות-אוטורוטציה — תמרונים שרק טייסי-מסוק חריגים ביכולתם מסוגלים לבצע בעצמם, כפי שתיארו החוקרים במאמרם משנת 2010. ב-2013 השתמשו סטפאן רוס ועמיתיו באותה גישה כדי לאמן רחפן-קוודרוטור זעיר לנווט לבדו לאורך שבילי-יער עמוסי-עצים, בהסתמך על מצלמה זולה בודדת בלבד ומהירות-טיסה של עד 1.5 מטר בשנייה, ועל בסיס קבוצה קטנה בלבד של הדגמות-טיסה של טייס אנושי.