למידת חיזוק (Reinforcement Learning)
הגדרה
למידת חיזוק (Reinforcement Learning) היא שיטת אימון שבה מודל לומד על ידי ניסוי וטעייה, ומקבל "פרס" וירטואלי כשהוא מצליח.
💡 דוגמה
כמו לאלף כלב שמקבל חטיף כשהוא עושה נכון. מודל שלומד משחק מחשב מנסה, מפסיד, מנסה שוב, ומקבל "נקודות" על כל הצלחה.
למידת חיזוק (Reinforcement Learning) היא שיטת אימון שונה מהותית מרוב שיטות למידת המכונה: במקום ללמוד מדוגמאות מתויגות מראש, המודל ("הסוכן") לומד על ידי ניסוי וטעייה בסביבה, ומקבל "פרס" וירטואלי כשהוא מצליח — בדומה לאילוף. אתגר-ליבה בשיטה הוא האיזון בין "חקירה" (Exploration, ניסיון פעולות חדשות ולא-מוכרות שעשויות להסתבר כטובות יותר) ל"ניצול" (Exploitation, שימוש בפעולה שכבר ידוע שהיא עובדת טוב) — סוכן שרק מנצל עלול להיתקע באסטרטגיה בינונית, וסוכן שרק חוקר לא מפיק תועלת ממה שכבר למד.
הדוגמה המפורסמת ביותר לשיטה היא AlphaGo של Google DeepMind, שלמד לשחק גו (משחק-לוח סיני עתיק ומורכב בהרבה משחמט) בעיקר על ידי משחק נגד עצמו מיליוני פעמים, מקבל "פרס" על ניצחון ו"עונש" על הפסד. ב-2016 AlphaGo ניצח את לי סה-דול, אז אלוף-העולם, במפגש שנחשב לרגע-מפנה — התבוסה הראשונה של שחקן-גו עולמי מול מכונה. AlphaGo שילב "למידת חיזוק עמוקה" (Deep Reinforcement Learning) — למידת חיזוק באמצעות רשתות נוירונים עמוקות — עם למידה ממשחקי מומחים ועם חיפוש בעץ המהלכים. השילוב בין למידת חיזוק לרשתות עמוקות מאפשר לסוכן לקבל החלטות מתוך קלט גולמי, בלי להגדיר ידנית את התכונות שהרשת צריכה לחלץ ממנו: החל מ-2013 הדגימה DeepMind רשת כזו, DQN, שלמדה לשחק במשחקי Atari ישירות מהפיקסלים שעל המסך, כשהשינויים בניקוד שימשו לה כאות-תגמול.
מעבר למשחקים, השיטה משמשת היום באתגרים מהעולם האמיתי: למידת חיזוק לבקרת רובוטים ורכבים אוטונומיים, שלומדים תנועה יעילה מתוך ניסוי-וטעייה בסימולציה, ואופטימיזציה של אחסון-אנרגיה בזמן-אמת ברשתות חשמל. מגבלה מרכזית שמפחיתה שימוש רחב יותר היא "חוסר-יעילות-בדוגמאות" (Sample Inefficiency) — סוכן טיפוסי זקוק למיליוני ניסיונות כדי ללמוד משימה שאדם לומד מכמה נסיונות בודדים, מה שמייקר משמעותית אימון על משימות אמיתיות ולא רק בסימולציה זולה.
שיטה קרובה, RLHF (למידת חיזוק מפידבק אנושי), משמשת גם באימון מודלי שפה גדולים לענות באופן מועיל ובטוח יותר — בני אדם מדרגים תשובות שונות של המודל, וההערכות משמשות כ"פרס" שמכוון את המודל להתנהגות רצויה. גם ChatGPT ו-InstructGPT, המודל שקדם לו ב-OpenAI, נשענו במידה רבה על השיטה הזו כדי לעבור ממודל-חיזוי-טקסט גולמי לעוזר-שיחה שימושי.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות