ניטור שרשרת-המחשבה (Chain-of-Thought Monitorability)

בטיחות ואתיקה

הגדרה

גישת פיקוח שבה מערכת אוטומטית קוראת את שרשרת-המחשבה שמודל מנסח בשפה אנושית ומסמנת אינטראקציות חשודות — הזדמנות שמאמר העמדה המכונן מגדיר במפורש כשבירה.

מה מנטרים כאן

מודל היסק מנסח לפני התשובה טקסט ביניים בשפה אנושית — הטכניקה שבה עוסק הערך שרשור מחשבה. ניטור שרשרת-המחשבה הוא הרעיון להשתמש בטקסט הזה כשכבת פיקוח: מערכת אוטומטית קוראת אותו יחד עם מידע רלוונטי נוסף, ומסמנת אינטראקציות חשודות או כאלה שעלולות להזיק. תגובה שסומנה אפשר לחסום, להחליף בפעולה בטוחה יותר או להעביר לבדיקה מעמיקה. את הרעיון ניסח מאמר עמדה בשם "Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety", שפורסם ב-15 ביולי 2025 ועודכן ב-7 בדצמבר 2025.

למה הטקסט הזה קריא בכלל

המאמר מונה שתי סיבות נפרדות. הראשונה היא הכרח: במשימות קשות דיין ארכיטקטורת הטרנספורמר נאלצת להשתמש בשרשרת-המחשבה כמעין זיכרון עבודה, וברירת המחדל היא שבני אדם מסוגלים להבין אותה. השנייה היא נטייה: מודלים מנסחים את הנמקתם החוצה גם כשאין בכך הכרח — אך המאמר מציין שהנטייה הזו אינה יציבה במיוחד. ההבחנה חשובה, משום שרק הראשונה נשענת על אילוץ חישובי, ואילו השנייה היא הרגל שאפשר לשנות באימון.

מה אי-אפשר להסיק מזה

אין לקרוא את שרשרת-המחשבה כתיעוד של מה שהמודל "חושב". המאמר עצמו כותב שעקבות ההנמקה הם ייצוג חלקי, ושהם עלולים להיות בדויים או הצגתיים; ובמודל שאינו מודל היסק, טקסט כזה נתון לאותם לחצי אימון שמעצבים כל פלט אחר — להיראות מועיל ובלתי מזיק — ולכן אמינותו מוגבלת. הניטור הוא אמצעי בקרה שתופס חלק מן ההתנהגות הבעייתית ומחמיץ חלק ממנה, ולא חלון אל ההנמקה האמיתית.

למה ההזדמנות שבירה

כותרת המאמר מגדירה את ההזדמנות כחדשה ושבירה, והוא מונה כמה דרכים שבהן היא עלולה להישחק. אימון חיזוק בהיקף גדול, המתגמל על התוצאה בלבד, עלול להרחיק את הטקסט משפה אנגלית קריאה. פיקוח ישיר על תהליך ההנמקה עלול לגרום לשרשרת לשקף פחות נאמנה את הדרך שבה המודל מגיע להחלטותיו. ארכיטקטורות שמנמקות במרחב סמוי אינן חייבות לנסח דבר, ואיתן נעלם היתרון כולו. ולבסוף, מודלים עתידיים עשויים להיות מודעים למצב שבו הם נבחנים ולהתגבר על הנטייה לנסח בקול, וכך להתחמק מזיהוי.

מה מבקשים מהמפתחים, ומי חתום

ההמלצות מעשיות: לפתח מדדים סטנדרטיים ליכולת הניטור, לפרסם את תוצאותיהם בכרטיס המערכת, ולשקלל אותם בהחלטות אימון ופריסה — לתעד מעבר לארכיטקטורה שאינה ניתנת לניטור, ולהעדיף נקודת שמירה מוקדמת יותר כשהיכולת נשחקת. על המאמר חתומים 41 מחברים משיוכים מוסדיים מתחרים, ובהם Anthropic, OpenAI, Google DeepMind, UK AI Security Institute, Apollo Research, METR ו-Redwood Research, וביניהם יושוע בנג'יו; המאמר מבהיר שהוא מייצג את עמדת המחברים ולא בהכרח את עמדת מוסדותיהם. המאמר מונה גם ארבעה מומחים תומכים: סמואל בואמן, ג'ון שולמן, ג'פרי הינטון ואיליה סוצקבר. ב-18 בדצמבר 2025 פרסמה OpenAI מערך של 13 הערכות ב-24 סביבות למדידת היכולת הזו — מענה ישיר להמלצה הראשונה.

שאלות נפוצות ❓

האם ניטור שרשרת-המחשבה מאפשר לקרוא מה המודל חושב?

לא. המאמר עצמו כותב שעקבות ההנמקה הם ייצוג חלקי, שהם עלולים להיות בדויים או הצגתיים, ושבמודל שאינו מודל היסק הטקסט נתון לאותם לחצי אימון כמו כל פלט אחר. זהו אמצעי בקרה שתופס חלק מן ההתנהגות הבעייתית, לא חלון אל ההנמקה האמיתית.

למה בכלל אפשר לנטר את הטקסט הזה?

משתי סיבות נפרדות שהמאמר מונה. הכרח — במשימות קשות דיין ארכיטקטורת הטרנספורמר נאלצת להשתמש בשרשרת-המחשבה כזיכרון עבודה, ובני אדם מסוגלים לקרוא אותה; ונטייה — מודלים מנסחים את הנמקתם החוצה גם כשאין בכך הכרח, אך זו נטייה שאינה יציבה במיוחד.

למה ההזדמנות מוגדרת "שבירה"?

משום שכמה בחירות פיתוח עלולות לשחוק אותה: אימון חיזוק המתגמל על התוצאה בלבד עלול להרחיק את הטקסט משפה קריאה; פיקוח ישיר על ההנמקה עלול לגרום לה לשקף פחות נאמנה את דרך ההחלטה; ארכיטקטורות שמנמקות במרחב סמוי אינן מנסחות דבר; ומודלים עתידיים עשויים להתגבר על הנטייה לנסח בקול.

מה המאמר מבקש מחברות הפיתוח?

לפתח מדדים סטנדרטיים ליכולת הניטור, לפרסם את תוצאותיהם בכרטיס המערכת, ולשקלל אותם בהחלטות אימון ופריסה — ובכלל זה לתעד מעבר לארכיטקטורה שאינה ניתנת לניטור ולהעדיף נקודת שמירה מוקדמת יותר כשהיכולת נשחקת.

מי חתום על המאמר?

41 מחברים משיוכים מוסדיים מתחרים, ובהם Anthropic, OpenAI, Google DeepMind, UK AI Security Institute, Apollo Research, METR ו-Redwood Research, וביניהם יושוע בנג'יו. המאמר מבהיר שהוא מייצג את עמדת המחברים ולא בהכרח את עמדת מוסדותיהם. המאמר מונה גם ארבעה מומחים תומכים: סמואל בואמן, ג'ון שולמן, ג'פרי הינטון ואיליה סוצקבר.