יישור (Alignment)
בטיחות ואתיקה
יישור (Alignment) הוא התחום שעוסק בלוודא שמודל AI פועל בפועל בהתאם לכוונות וערכים אנושיים רצויים — לא רק "עונה נכון" מבחינה טכנית-סטטיסטית.
הבעיה המרכזית: מודל AI מאומן לבצע היטב את מה שהוא נמדד עליו, אבל המדד עצמו עלול לפספס את מה שאנחנו באמת רוצים — פער בין "מה שנמדד" ל"מה שרצוי באמת".
טכניקות יישור נפוצות כוללות למידת חיזוק מפידבק אנושי ו"הקשחה" של המודל דרך פרומפט מערכת קפדני. יישור-יתר (מודל זהיר ומתחמק מדי) נחשב לבעיה בפני עצמה, לא פחות ממודל חופשי-מדי.