מה מנטרים כאן
מודל היסק מנסח לפני התשובה טקסט ביניים בשפה אנושית — הטכניקה שבה עוסק הערך שרשור מחשבה. ניטור שרשרת-המחשבה הוא הרעיון להשתמש בטקסט הזה כשכבת פיקוח: מערכת אוטומטית קוראת אותו יחד עם מידע רלוונטי נוסף, ומסמנת אינטראקציות חשודות או כאלה שעלולות להזיק. תגובה שסומנה אפשר לחסום, להחליף בפעולה בטוחה יותר או להעביר לבדיקה מעמיקה. את הרעיון ניסח מאמר עמדה בשם "Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety", שפורסם ב-15 ביולי 2025 ועודכן ב-7 בדצמבר 2025.
למה הטקסט הזה קריא בכלל
המאמר מונה שתי סיבות נפרדות. הראשונה היא הכרח: במשימות קשות דיין ארכיטקטורת הטרנספורמר נאלצת להשתמש בשרשרת-המחשבה כמעין זיכרון עבודה, וברירת המחדל היא שבני אדם מסוגלים להבין אותה. השנייה היא נטייה: מודלים מנסחים את הנמקתם החוצה גם כשאין בכך הכרח — אך המאמר מציין שהנטייה הזו אינה יציבה במיוחד. ההבחנה חשובה, משום שרק הראשונה נשענת על אילוץ חישובי, ואילו השנייה היא הרגל שאפשר לשנות באימון.
מה אי-אפשר להסיק מזה
אין לקרוא את שרשרת-המחשבה כתיעוד של מה שהמודל "חושב". המאמר עצמו כותב שעקבות ההנמקה הם ייצוג חלקי, ושהם עלולים להיות בדויים או הצגתיים; ובמודל שאינו מודל היסק, טקסט כזה נתון לאותם לחצי אימון שמעצבים כל פלט אחר — להיראות מועיל ובלתי מזיק — ולכן אמינותו מוגבלת. הניטור הוא אמצעי בקרה שתופס חלק מן ההתנהגות הבעייתית ומחמיץ חלק ממנה, ולא חלון אל ההנמקה האמיתית.
למה ההזדמנות שבירה
כותרת המאמר מגדירה את ההזדמנות כחדשה ושבירה, והוא מונה כמה דרכים שבהן היא עלולה להישחק. אימון חיזוק בהיקף גדול, המתגמל על התוצאה בלבד, עלול להרחיק את הטקסט משפה אנגלית קריאה. פיקוח ישיר על תהליך ההנמקה עלול לגרום לשרשרת לשקף פחות נאמנה את הדרך שבה המודל מגיע להחלטותיו. ארכיטקטורות שמנמקות במרחב סמוי אינן חייבות לנסח דבר, ואיתן נעלם היתרון כולו. ולבסוף, מודלים עתידיים עשויים להיות מודעים למצב שבו הם נבחנים ולהתגבר על הנטייה לנסח בקול, וכך להתחמק מזיהוי.
מה מבקשים מהמפתחים, ומי חתום
ההמלצות מעשיות: לפתח מדדים סטנדרטיים ליכולת הניטור, לפרסם את תוצאותיהם בכרטיס המערכת, ולשקלל אותם בהחלטות אימון ופריסה — לתעד מעבר לארכיטקטורה שאינה ניתנת לניטור, ולהעדיף נקודת שמירה מוקדמת יותר כשהיכולת נשחקת. על המאמר חתומים 41 מחברים משיוכים מוסדיים מתחרים, ובהם Anthropic, OpenAI, Google DeepMind, UK AI Security Institute, Apollo Research, METR ו-Redwood Research, וביניהם יושוע בנג'יו; המאמר מבהיר שהוא מייצג את עמדת המחברים ולא בהכרח את עמדת מוסדותיהם. המאמר מונה גם ארבעה מומחים תומכים: סמואל בואמן, ג'ון שולמן, ג'פרי הינטון ואיליה סוצקבר. ב-18 בדצמבר 2025 פרסמה OpenAI מערך של 13 הערכות ב-24 סביבות למדידת היכולת הזו — מענה ישיר להמלצה הראשונה.