RLHF (למידת-חיזוק מהעדפות אנושיות)
מודלים ושפה
לאחר כוונון-הוראות, מעריכים אנושיים משווים כמה תשובות אפשריות לאותה שאלה ומדרגים אותן מהטובה לפחות-טובה. הדירוגים האלה מאמנים "מודל-תגמול" נפרד שלומד לחזות מה בני-אדם יעדיפו.
לאחר מכן, המודל המקורי מכוונן שוב באמצעות למידת-חיזוק, כדי לייצר יותר תשובות שמודל-התגמול מדרג גבוה — כך המודל "לומד" סגנון, טון ובטיחות מהעדפות אנושיות, לא רק מדוגמאות-טקסט גולמיות.