מסגרת בטיחות חזיתית (Frontier AI Safety Framework)

בטיחות ואתיקה

הגדרה

מסגרת בטיחות חזיתית (Frontier AI Safety Framework) היא מסמך שחברת-AI מפרסמת מראש, ובו ספי-סיכון שמעליהם היא מתחייבת לא לפתח מודל ולא לפרוס אותו כלל — אם אמצעי-המיתון אינם מספיקים.

התשובה לשאלה מה קורה כשהבדיקה נכשלת

בדיקות-פריצה יזומות (Red Teaming) עונות על השאלה איך בודקים מודל, ומעקות בטיחות (Guardrails) על השאלה מה חוסמים בו. מסגרת בטיחות חזיתית עונה על שאלה שלישית, שאף אחד מהשניים אינו נוגע בה: מה עושים כשהבדיקה מגלה יכולת מסוכנת מדי. זהו סוג של מסמך ולא מסמך אחד — כל אחת מחברות-החזית מפרסמת גרסה משלה — והמשותף לכולן הוא השלד: רשימת ספי-יכולת, אמצעי-מיתון המוצמדים לכל סף, וכלל-החלטה שקובע מה מותר לשחרר ומה לא.

מאין זה בא: פסגת סיאול 2024

המקור הוא מסמך התחייבויות בטיחות ה-AI החזיתי של פסגת סיאול ב-2024. שש-עשרה חברות וארגונים אימצו אותו בפסגה, ובהם OpenAI, Anthropic, Google, Meta, Microsoft ואמזון, וארבעה נוספים צורפו לרשימה מאוחר יותר: Magic, Minimax, 01.ai ו-NVIDIA. החותמים התחייבו לקבוע ספים שמעליהם סיכון חמור ייחשב בלתי-נסבל, ולפרסם מסגרת-בטיחות עד הפסגה הבאה בצרפת. הסעיף החד ביותר במסמך הוא זה: במקרה הקיצוני, הארגונים מתחייבים לא לפתח מודל או מערכת ולא לפרוס אותם כלל, אם לא ניתן להחיל אמצעי-מיתון שישמרו את הסיכונים מתחת לספים. לצד זאת נכללו במסמך התחייבויות נוספות, ובהן בדיקות-פריצה פנימיות וחיצוניות, השקעה באבטחת-סייבר ובהגנה מפני איום פנימי כדי לשמור על משקלי-מודל שטרם שוחררו, ודיווח פומבי על יכולות המודל ומגבלותיו.

שלוש המסגרות המוכרות

Anthropic פרסמה בספטמבר 2023 את מדיניות ההרחבה האחראית שלה (Responsible Scaling Policy), ובה ספי-יכולת שכל אחד מהם מפעיל תקן-אבטחה ופריסה מחמיר יותר; המסמך מתעדכן בגרסאות ממוספרות, וגרסה 3.4 נכנסה לתוקף ביולי 2026. Google DeepMind פרסמה בספטמבר 2025 את המהדורה השלישית של מסגרת הבטיחות החזיתית שלה, המנוסחת סביב רמות-יכולת קריטיות; באותה מהדורה נוספה רמה חדשה שעניינה מניפולציה מזיקה — מודל שיכולתו לשנות אמונות והתנהגות בהקשרים רגישים עלולה לשמש לרעה. OpenAI עדכנה באפריל 2025 את מסגרת המוכנות שלה (Preparedness Framework), וצמצמה אותה לשתי דרגות: יכולת גבוהה ויכולת קריטית.

מה משותף להן, ומה חסר בהן

בשלושתן חוזר אותו רצף: הגדרת סף, הערכה מולו, אמצעי-מיתון, והכרעה. אצל OpenAI, למשל, מערכת שהגיעה ליכולת גבוהה מחויבת באמצעי-הגנה שמצמצמים די-הצורך את הסיכון לנזק חמור לפני שהיא נפרסת, ואילו יכולת קריטית מחייבת אמצעים כאלה כבר במהלך הפיתוח עצמו. החולשה המובנית זהה בכולן: החברה כותבת את הסף, מודדת מולו ומכריעה בעצמה, בלי גורם חיצוני שמכריע במקומה — אותה ביקורת בדיוק שהושמעה על כרטיס מודל (Model Card). יש בכל זאת תנועה בכיוון הזה: גרסאות 3.2 ו-3.4 של המדיניות של Anthropic מסדירות בחינה חיצונית של דוחות-הסיכון שלה.

מהתחייבות מרצון לחובה בחוק

ב-2025 הפכה קליפורניה את סוג-המסמך הזה לדרישה משפטית. חוק השקיפות בבינה מלאכותית חזיתית מחייב מפתח-חזית גדול לכתוב מסגרת-בטיחות, ליישם אותה, לציית לה ולפרסם אותה באתרו — ולתאר בה בין השאר כיצד הוא מגדיר ספים לזיהוי יכולת שעלולה להוליד סיכון קטסטרופלי, אילו אמצעי-מיתון הוא מחיל, וכיצד גורמים שלישיים מעריכים אותם. עליו לבחון את המסגרת אחת לשנה לפחות, ולפרסם כל שינוי מהותי בה בצירוף נימוק בתוך 30 יום.

שאלות נפוצות ❓

מה בדיוק מתחייבת חברה שמפרסמת מסגרת כזאת?

לקבוע מראש ספים שמעליהם סיכון נחשב בלתי-נסבל, למדוד את המודל מולם, ולהחיל אמצעי-מיתון. בנוסח פסגת סיאול, במקרה הקיצוני היא מתחייבת לא לפתח מודל או מערכת ולא לפרוס אותם כלל, אם אי-אפשר להחיל אמצעים שישמרו את הסיכונים מתחת לספים.

מאיפה הגיע הרעיון?

מהתחייבויות בטיחות ה-AI החזיתי של פסגת סיאול ב-2024, שאותן אימצו שש-עשרה חברות וארגונים, ובהם OpenAI, Anthropic, Google, Meta ומיקרוסופט; ארבעה נוספים — Magic, Minimax, 01.ai ו-NVIDIA — צורפו לרשימה מאוחר יותר. החותמים התחייבו לפרסם מסגרת-בטיחות עד הפסגה שלאחר מכן, בצרפת.

אילו מסגרות כאלה קיימות בפועל?

המוכרות שבהן הן מדיניות ההרחבה האחראית של Anthropic, שראשיתה בספטמבר 2023; מסגרת הבטיחות החזיתית של Google DeepMind, שמהדורתה השלישית פורסמה בספטמבר 2025; ומסגרת המוכנות של OpenAI, שעודכנה באפריל 2025 וצומצמה לשתי דרגות יכולת.

מי בודק שהחברה עומדת במסגרת שלה?

בעיקרון החברה עצמה. היא מנסחת את הספים, מודדת מולם ומכריעה, ואין גורם חיצוני שמכריע במקומה. גרסאות מאוחרות של המדיניות של Anthropic מסדירות בחינה חיצונית של דוחות-הסיכון שלה — בחינה, לא אישור. חוק קליפורני מ-2025 מחייב עכשיו מפתח-חזית גדול לפרסם את המסגרת, לציית לה ולבחון אותה אחת לשנה לפחות, אך הספים עצמם נשארים בידיו.

האם זה עדיין עניין של רצון טוב בלבד?

כבר לא לגמרי. חוק השקיפות בבינה מלאכותית חזיתית של קליפורניה מחייב מפתח-חזית גדול לכתוב מסגרת כזאת, ליישם אותה, לציית לה ולפרסם אותה באתרו, ולפרסם כל שינוי מהותי בה בצירוף נימוק בתוך 30 יום.