למידת חיזוק (Reinforcement Learning)
יסודות בינה מלאכותית
למידת חיזוק (Reinforcement Learning) היא שיטת אימון שונה מהותית מרוב שיטות למידת המכונה: במקום ללמוד מדוגמאות מתויגות מראש, המודל ("הסוכן") לומד על ידי ניסוי וטעייה בסביבה, ומקבל "פרס" וירטואלי כשהוא מצליח — בדומה לאילוף.
דוגמה קלאסית: מודל שלומד לשחק שחמט על ידי משחק נגד עצמו מיליוני פעמים, מקבל "פרס" על ניצחון ו"עונש" על הפסד, ובהדרגה מגלה אסטרטגיות טובות — בלי שאף אחד לימד אותו כלל אסטרטגי אחד במפורש.
שיטה קרובה, RLHF (למידת חיזוק מפידבק אנושי), משמשת גם באימון מודלי שפה גדולים לענות באופן מועיל ובטוח יותר — בני אדם מדרגים תשובות שונות של המודל, וההערכות משמשות כ"פרס" שמכוון את המודל להתנהגות רצויה.