המונח: כריס אולה ומעבר מ'תוצאה' ל'מנגנון'
את המונח "פרשנות מכניסטית" (Mechanistic Interpretability) טבע כריס אולה, שהוביל אז את צוות-הפרשנות ב-OpenAI (2018–2020) ולפני כן עבד בגוגל בריין, ולאחר מכן, ב-2021, היה שותף-מייסד ב-Anthropic — כדי לתאר את מחקר-המעגלים שלו, בניגוד לשיטות המקובלות אז בתחום ה-AI המוסבר, שהתמקדו במיפוי-תרומה (Attribution) של קלט בודד לפלט בודד. במקום לשאול "אילו פיקסלים בתמונה הזו הובילו לתשובה הזו", אולה וצוותו שאלו שאלה שאפתנית יותר: אילו מנגנונים כלליים, שנוצרו במשקלי-הרשת בזמן האימון, אחראים לתוצאה — בדומה להנדסה-לאחור של תוכנה מקומפלת, לא ניתוח סטטיסטי-חיצוני של התנהגותה.
התזה: 'תכונות' ו'מעגלים' כיחידת-הניתוח
המאמר המכונן של הגישה, "Zoom In: An Introduction to Circuits" (אולה, קמראטה ועמיתים, מרץ 2020, כתב-העת Distill), הציג שלוש טענות שהפכו לבסיס-העבודה של התחום: שרשתות-נוירונים מכילות "תכונות" (Features) — כיוונים משמעותיים במרחב-ההפעלה הפנימי של הרשת, לא רק נוירונים בודדים; שהתכונות מחוברות ביניהן ב"מעגלים" (Circuits) — תת-גרפים של משקלים שמממשים אלגוריתם ניתן-להבנה; ושתכונות ומעגלים דומים חוזרים על עצמם במודלים שונים לחלוטין (Universality) — עדות לכך שהם לא רעש-אקראי אלא מבנה-אמיתי שהאימון מגלה שוב ושוב.
המעבר לטרנספורמרים: ראשי-אינדוקציה כמנגנון קונקרטי ראשון
עד 2020 מרבית עבודת-המעגלים התמקדה ברשתות-ראייה (כמו InceptionV1); המעבר לענף המרכזי כיום — מודלי-שפה מבוססי-טרנספורמר — הגיע במאמר "A Mathematical Framework for Transformer Circuits" (Anthropic, 2021), שפירק את פעולת הטרנספורמר למונחים מתמטיים מדויקים די-הצורך כדי להסביר כמעט-במלואם מודלים קטנים בני שכבת-קשב אחת או שתיים. מהמסגרת הזו צמח גילוי קונקרטי: "ראשי-אינדוקציה" (Induction Heads) — סוג ספציפי של רכיב-קשב שמתפתח רק ברשתות עם שתי שכבות-קשב לפחות, ולפי מאמר-המשך מ-2022 ("In-context Learning and Induction Heads") אחראי לחלק ניכר מהיכולת של מודלי-שפה גדולים ללמוד מדוגמאות בתוך החלון-הקשר עצמו, בלי עדכון-משקלים נוסף. זו הייתה הפעם הראשונה שנמצא מנגנון קונקרטי, לא רק תיאורטי, שמסביר תופעה מדידה בביצועי מודל-שפה אמיתי.
המכשול: 'פוליסמנטיות', והפתרון — אוטואנקודרים דלילים
הבעיה המעשית המרכזית שעצרה את הגישה בקנה-מידה גדול היא "פוליסמנטיות" (Polysemanticity): נוירון בודד ברשת גדולה נוטה לקודד כמה מושגים לא-קשורים בו-זמנית, לא מושג אחד נקי — מה שהופך פענוח נוירון-אחר-נוירון לבלתי-אפשרי בפרקטיקה. הפתרון שצוות-הפרשנות של Anthropic פרסם באוקטובר 2023 ("Towards Monosemanticity") הראה ש"אוטואנקודר דליל" (Sparse Autoencoder) יכול לפרק שכבת-טרנספורמר קטנה בת 512 נוירונים למעל 4,000 "תכונות" נקיות-משמעות. ב-2024 הצוות הרחיב את השיטה לקנה-מידה תעשייתי במאמר "Scaling Monosemanticity": אוטואנקודר דליל עם עד 34 מיליון תכונות, שאומן על שכבה אמצעית בתוך Claude 3 Sonnet — מודל-שפה גדול בפועל, לא רשת-צעצוע מוקטנת — וחשף תכונות ספציפיות עבור ישויות מוכרות וטעויות-קוד, וגם תכונות רלוונטיות-לבטיחות כמו הטעיה, חתירה-לכוח וחנפנות.
היחס לפרשנות-מוסברת הכללית
פרשנות מכניסטית היא ענף ספציפי בתוך התחום הרחב של בינה מלאכותית מוסברת (Explainable AI), לא תחליף לו. שיטות XAI מקובלות כמו LIME ו-SHAP מתייחסות למודל כ"קופסה שחורה" ומסבירות תוצאה בודדת מבחוץ — אילו מאפייני-קלט השפיעו הכי הרבה על החלטה נתונה. פרשנות מכניסטית שואפת לפתוח את הקופסה עצמה: לא להסביר החלטה בודדת, אלא להבין ולתעד את האלגוריתם הכללי שהמודל למד ומריץ על כל קלט — יומרה גבוהה משמעותית, שמאפשרת בעיקרון לחזות איך המודל יתנהג על קלטים שטרם נראו, ולא רק לפרש בדיעבד תוצאה שכבר התקבלה.
למה זה חשוב: בטיחות, לא רק סקרנות
המניע המרכזי מאחורי ההשקעה הגוברת בתחום, בעיקר ב-Anthropic, הוא בטיחות: אם אפשר לזהות בתוך רשת-נוירונים תכונה שמייצגת כוונת-הטעיה או חתירה-לכוח לפני שהיא מתבטאת בפלט, אפשר בעיקרון לזהות התנהגות-בעייתית מוקדם יותר משיטות שמסתמכות רק על צפייה בתשובות הסופיות. עם זאת, התחום עדיין רחוק מיכולת לפרש רשת גדולה במלואה — גם המאמרים המתקדמים ביותר מכסים רק חלק מהמנגנון הפנימי של מודלים מובילים, לא את כולו, וההנדסה-לאחור נותרת עבודה חלקית ואיטית ביחס לקצב-הגידול של המודלים עצמם.