התשובה לשאלה מה קורה כשהבדיקה נכשלת
בדיקות-פריצה יזומות (Red Teaming) עונות על השאלה איך בודקים מודל, ומעקות בטיחות (Guardrails) על השאלה מה חוסמים בו. מסגרת בטיחות חזיתית עונה על שאלה שלישית, שאף אחד מהשניים אינו נוגע בה: מה עושים כשהבדיקה מגלה יכולת מסוכנת מדי. זהו סוג של מסמך ולא מסמך אחד — כל אחת מחברות-החזית מפרסמת גרסה משלה — והמשותף לכולן הוא השלד: רשימת ספי-יכולת, אמצעי-מיתון המוצמדים לכל סף, וכלל-החלטה שקובע מה מותר לשחרר ומה לא.
מאין זה בא: פסגת סיאול 2024
המקור הוא מסמך התחייבויות בטיחות ה-AI החזיתי של פסגת סיאול ב-2024. שש-עשרה חברות וארגונים אימצו אותו בפסגה, ובהם OpenAI, Anthropic, Google, Meta, Microsoft ואמזון, וארבעה נוספים צורפו לרשימה מאוחר יותר: Magic, Minimax, 01.ai ו-NVIDIA. החותמים התחייבו לקבוע ספים שמעליהם סיכון חמור ייחשב בלתי-נסבל, ולפרסם מסגרת-בטיחות עד הפסגה הבאה בצרפת. הסעיף החד ביותר במסמך הוא זה: במקרה הקיצוני, הארגונים מתחייבים לא לפתח מודל או מערכת ולא לפרוס אותם כלל, אם לא ניתן להחיל אמצעי-מיתון שישמרו את הסיכונים מתחת לספים. לצד זאת נכללו במסמך התחייבויות נוספות, ובהן בדיקות-פריצה פנימיות וחיצוניות, השקעה באבטחת-סייבר ובהגנה מפני איום פנימי כדי לשמור על משקלי-מודל שטרם שוחררו, ודיווח פומבי על יכולות המודל ומגבלותיו.
שלוש המסגרות המוכרות
Anthropic פרסמה בספטמבר 2023 את מדיניות ההרחבה האחראית שלה (Responsible Scaling Policy), ובה ספי-יכולת שכל אחד מהם מפעיל תקן-אבטחה ופריסה מחמיר יותר; המסמך מתעדכן בגרסאות ממוספרות, וגרסה 3.4 נכנסה לתוקף ביולי 2026. Google DeepMind פרסמה בספטמבר 2025 את המהדורה השלישית של מסגרת הבטיחות החזיתית שלה, המנוסחת סביב רמות-יכולת קריטיות; באותה מהדורה נוספה רמה חדשה שעניינה מניפולציה מזיקה — מודל שיכולתו לשנות אמונות והתנהגות בהקשרים רגישים עלולה לשמש לרעה. OpenAI עדכנה באפריל 2025 את מסגרת המוכנות שלה (Preparedness Framework), וצמצמה אותה לשתי דרגות: יכולת גבוהה ויכולת קריטית.
מה משותף להן, ומה חסר בהן
בשלושתן חוזר אותו רצף: הגדרת סף, הערכה מולו, אמצעי-מיתון, והכרעה. אצל OpenAI, למשל, מערכת שהגיעה ליכולת גבוהה מחויבת באמצעי-הגנה שמצמצמים די-הצורך את הסיכון לנזק חמור לפני שהיא נפרסת, ואילו יכולת קריטית מחייבת אמצעים כאלה כבר במהלך הפיתוח עצמו. החולשה המובנית זהה בכולן: החברה כותבת את הסף, מודדת מולו ומכריעה בעצמה, בלי גורם חיצוני שמכריע במקומה — אותה ביקורת בדיוק שהושמעה על כרטיס מודל (Model Card). יש בכל זאת תנועה בכיוון הזה: גרסאות 3.2 ו-3.4 של המדיניות של Anthropic מסדירות בחינה חיצונית של דוחות-הסיכון שלה.
מהתחייבות מרצון לחובה בחוק
ב-2025 הפכה קליפורניה את סוג-המסמך הזה לדרישה משפטית. חוק השקיפות בבינה מלאכותית חזיתית מחייב מפתח-חזית גדול לכתוב מסגרת-בטיחות, ליישם אותה, לציית לה ולפרסם אותה באתרו — ולתאר בה בין השאר כיצד הוא מגדיר ספים לזיהוי יכולת שעלולה להוליד סיכון קטסטרופלי, אילו אמצעי-מיתון הוא מחיל, וכיצד גורמים שלישיים מעריכים אותם. עליו לבחון את המסגרת אחת לשנה לפחות, ולפרסם כל שינוי מהותי בה בצירוף נימוק בתוך 30 יום.