למידת חיזוק (Reinforcement Learning)

יסודות בינה מלאכותית

למידת חיזוק (Reinforcement Learning) היא שיטת אימון שונה מהותית מרוב שיטות למידת המכונה: במקום ללמוד מדוגמאות מתויגות מראש, המודל ("הסוכן") לומד על ידי ניסוי וטעייה בסביבה, ומקבל "פרס" וירטואלי כשהוא מצליח — בדומה לאילוף.

דוגמה קלאסית: מודל שלומד לשחק שחמט על ידי משחק נגד עצמו מיליוני פעמים, מקבל "פרס" על ניצחון ו"עונש" על הפסד, ובהדרגה מגלה אסטרטגיות טובות — בלי שאף אחד לימד אותו כלל אסטרטגי אחד במפורש.

שיטה קרובה, RLHF (למידת חיזוק מפידבק אנושי), משמשת גם באימון מודלי שפה גדולים לענות באופן מועיל ובטוח יותר — בני אדם מדרגים תשובות שונות של המודל, וההערכות משמשות כ"פרס" שמכוון את המודל להתנהגות רצויה.