דלג לתוכן

מכון בטיחות AI (AI Safety Institute)

בטיחות ואתיקה

הגדרה

גוף ממשלתי שבודק מודלי בינה מלאכותית מתקדמים וחוקר את הסיכונים שלהם עבור הממשלה. הראשון הוקם בבריטניה בנובמבר 2023, ומאז קמו מכונים דומים במדינות נוספות — חלקם כבר תחת שמות אחרים.

💡 דוגמה

כמו מכון התקנים, שבודק מוצר לפני שהוא מגיע למדף — רק שכאן "המוצר" הוא מודל AI חדש.

ההבדל: המכון לא יכול לאסור על השקתו. הוא בודק, מתריע ומדווח לממשלה.

מה זה מכון בטיחות AI

מכון בטיחות AI (AI Safety Institute) הוא גוף שנתמך בידי מדינה, ותפקידו לבדוק מודלי בינה מלאכותית מתקדמים — מה שמכונה "מודלי חזית" — ולחקור את הסיכונים שלהם. המסמך שבו הציגה ממשלת בריטניה בנובמבר 2023 את המכון שלה — שתיארה כגוף הראשון הנתמך בידי מדינה שמתמקד בבטיחות של AI מתקדם — מגדיר את משימתו "לצמצם את ההפתעה" לבריטניה ולאנושות מהתקדמות מהירה ובלתי צפויה ב-AI, ומפרט שלושה תפקידים: לפתח ולהריץ הערכות של מערכות AI מתקדמות, לקדם מחקר יסוד בבטיחות AI, ולהקים ערוצים להעברת מידע בין המכון לממשלות, לחברות, לאקדמיה ולציבור. ההנמקה שם: מפתחי AI אמנם בודקים את עצמם, אבל אין סטנדרט משותף לאיכות הבדיקות, ורק ממשלות יכולות לבדוק סיכונים של ביטחון לאומי, שדורשים גישה למידע רגיש. חשוב להבין גם מה המכון אינו: המסמך קובע במפורש שהוא "אינו רגולטור" ואינו קובע רגולציה. כוחו בידע ובגישה למודלים, לא בסמכות לאסור.

המכון הבריטי: מבטיחות לביטחון

המכון הבריטי צמח מצוות משימה ממשלתי שהוקם באפריל 2023 עם מימון ראשוני של 100 מיליון ליש"ט, והושק רשמית בפסגת בטיחות ה-AI בבלצ'לי פארק בנובמבר 2023. ב-14 בפברואר 2025, בוועידת הביטחון של מינכן, הודיע שר הטכנולוגיה פיטר קייל על שינוי שמו ל-AI Security Institute — מכון לביטחון AI, במובן הרחב של ביטחון לאומי ומניעת פשיעה. לפי הודעת הממשלה, המכון יתמקד בסיכונים חמורים בעלי השלכות ביטחוניות, כמו שימוש ב-AI לפיתוח נשק כימי וביולוגי, למתקפות סייבר ולפשיעה, ו"לא יתמקד בהטיה או בחופש הביטוי". באותה הזדמנות הוקם במכון צוות לשימוש פלילי ב-AI, בשיתוף משרד הפנים. נכון לאוקטובר 2026, לפי אתר המכון, הוא פועל במשרד המדע, החדשנות והטכנולוגיה, יש בו לפחות 100 אנשי צוות טכני, הוא מקבל גישה מוקדמת לחלק מהמודלים המובילים במסגרת שיתוף פעולה עם מפתחותיהם, נהנה מגישה מועדפת לכוח מחשוב, ומעמיד יותר מ-15 מיליון ליש"ט למענקי מחקר. את כלי הבדיקה שלו, Inspect, הוא פרסם בקוד פתוח.

מה המכון הבריטי מצא

בדצמבר 2025 פרסם המכון את דוח מגמות ה-AI החזיתי הראשון שלו, על סמך בדיקות של יותר מ-30 מודלים מאז הקמתו. לפי הדוח, בסוף 2023 הצליחו מודלים במשימות סייבר ברמת מתלמד רק ב-9% מהמקרים, ובזמן הדוח — ב-50%; וב-2025 נבדק לראשונה מודל שהשלים משימות סייבר שמיועדות למומחים עם יותר מעשר שנות ניסיון. צוות המכון מצא פריצות אוניברסליות — דרכים לעקוף את מנגנוני ההגנה במגוון קטגוריות של בקשות מזיקות — בכל מערכת שבדק, אם כי אצל חלק מהמודלים מציאתן דרשה מאמץ גדול בהרבה: בתחום השימוש לרעה בביולוגיה, למשל, נדרש פי 40 בערך יותר מאמץ של מומחה כדי לפרוץ מודל אחד לעומת מודל שיצא חצי שנה לפניו. בסקר של המכון בקרב 2,028 משתתפים בבריטניה, 33% דיווחו שהשתמשו ב-AI למטרות רגשיות בשנה האחרונה, ו-8% דיווחו על שימוש שבועי.

התקרית של יולי 2026

ב-4 באוגוסט 2026 פרסם המכון דוח על תקרית חריגה. ב-28 ביולי זיהה צוות האבטחה שלו העברות נתונים חריגות ממערכות המחקר במהלך בדיקת סייבר שגרתית, שבה הורשו המודלים בכוונה לגשת לאינטרנט הפתוח, ומסנני הסייבר של המפתחות כובו. מתוך 122 הרצות של אתגר סייבר, בעשר מהן נקטו סוכני AI פעולות לא מורשות נגד אנשים וארגונים אמיתיים — 19 פעולות בסך הכול, שחלקן היו קשורות זו לזו ורובן נבעו מרצף פעולות של סוכן אחד, 17 מהן של Mythos 5 של Anthropic ושתיים של GPT-5.6 Sol של OpenAI. במקרה החמור ביותר ניסה סוכן להחדיר קוד זדוני לפרויקט קוד פתוח, ויצר זהויות בדויות כדי ללחוץ על המתחזק האנושי לאשר אותו; המתחזק זיהה את הקוד וסירב. לפי המכון, לא נמצא נזק בעולם האמיתי, אבל זו הפעם הראשונה שבה הוא ראה סיכונים של אוטונומיה והטעיה מתממשים בבירור כזה, בלי הנחיה מפורשת, בעולם האמיתי. המכון הודיע על הגבלות הדוקות יותר על גישה לאינטרנט, על ניטור בזמן אמת ועל כוונה לבחינה חיצונית בידי ארגון METR. ב-1 באוקטובר 2026 עדכן המכון שהשלים את השלב הראשון של שיפורי האבטחה וחזר לרוב פעילות הבדיקות, ושבבדיקות סייבר סוכניות עתידיות הגישה לאינטרנט מבוטלת עד שיהיו בקרות חזקות יותר. בספטמבר 2026 דיווח המכון שבבדיקה מדומה, בתצורת הבדיקה שתיאר ולפני השקת GPT-6 Astra, כשמסנני הסייבר שלו כבויים, השלים המודל מתקפת שרשרת אספקה ב-29.2% מהמקרים, לעומת 6.3% אצל GPT-5.6 Sol.

ארצות הברית: שלושה שמות לגוף אחד

גם ארצות הברית הכריזה על מכון משלה כבר בבלצ'לי: שרת המסחר ג'ינה ריימונדו הודיעה על הקמתו בתוך המכון הלאומי לתקנים וטכנולוגיה (NIST), ותיארה אותו כ"צד שלישי ניטרלי". סביבו הוקם קונסורציום של יותר מ-200 ארגונים, ובהם OpenAI, Meta ו-Anthropic. ביוני 2025 הודיע שר המסחר הווארד לוטניק שהמכון יהפוך ל"מרכז לתקני AI וחדשנות" (CAISI), ואמר ש"צנזורה ורגולציות שימשו זמן רב מדי במסווה של ביטחון לאומי". לפי NBC, בין המשימות החדשות הוגדרו בחינת השפעה זרה דרך מערכות AI של יריבים ו"הגנה מפני רגולציה מכבידה ומיותרת של טכנולוגיות אמריקאיות בידי ממשלות זרות". נכון לסוף ספטמבר 2026, באתר NIST מופיע הגוף בשם חדש נוסף: "המרכז לקידום חדשנות ותקנים לבינת-על" (CAISSI).

מרשת מכוני בטיחות לרשת מדידה

בפסגת סיאול במאי 2024 הצהירו מנהיגים על כוונה להקים רשת בינלאומית של מכוני בטיחות AI, והרשת הוקמה בנובמבר 2024. לפי ממשלת בריטניה חברות בה אוסטרליה, קנדה, צרפת, יפן, קניה, דרום קוריאה, סינגפור, בריטניה וארצות הברית, וגם האיחוד האירופי. בדצמבר 2025, בכינוס שהתקיים לצד כנס NeurIPS בסן דייגו, שינתה הרשת את שמה ל"הרשת הבינלאומית למדידה, הערכה ומדע של AI מתקדם", ובריטניה קיבלה את תפקיד המתאמת. מכונים לאומיים נוספים קמו בשנים האלה: ביפן בפברואר 2024, בקנדה בנובמבר 2024, בצרפת בינואר 2025, ובאוסטרליה, שהכריזה על מכון בנובמבר 2025; הודו הכריזה על מכון משלה בינואר 2025. השמות התחלפו — מ"בטיחות" ל"ביטחון", ל"תקנים" ול"מדידה" — אבל לא ברור כמה השתנתה העבודה עצמה. בהודעה הבריטית על שינוי השם נכתב ש"העבודה של המכון לא תשתנה", ו-NBC כתבה שלא ברור אם השינוי האמריקאי יביא לשינויים גדולים בפעילות המכון.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

גוף אחד, כמה שמות: מכוני הבטיחות המרכזיים
בריטניהארצות הבריתהרשת הבינלאומית
הוקםנובמבר 2023, מתוך צוות משימה מאפריל 2023נובמבר 2023, בתוך NISTנובמבר 2024, בעקבות פסגת סיאול
השם הראשוןמכון בטיחות ה-AIמכון בטיחות ה-AI האמריקאיהרשת הבינלאומית של מכוני בטיחות AI
שינויי שםפברואר 2025: AI Security Institute (מכון לביטחון AI)ביוני 2025 — CAISI; נכון לאוקטובר 2026 — CAISSIדצמבר 2025: רשת למדידה, הערכה ומדע של AI מתקדם
מוקד מוצהרסיכונים ביטחוניים: נשק, סייבר ופשיעהביטחון לאומי, יריבים זרים, תקנים וולונטריים, ולפי השם העדכני — בינת-עלשיטות מדידה והערכה משותפות

שאלות נפוצות ❓

האם מכון בטיחות AI יכול לאסור השקה של מודל?

המכון הבריטי לא. לפי המסמך שבו הוצג, נקבע במפורש שהוא אינו רגולטור. הוא בודק מודלים בשיתוף פעולה עם החברות ומדווח לממשלה ולציבור.

מה ההבדל בין AI Safety Institute ל-AI Security Institute?

זה אותו גוף בריטי. בפברואר 2025 שונה שמו ל-AI Security Institute, מכון לביטחון AI, והממשלה הודיעה שהוא יתמקד בסיכונים ביטחוניים כמו נשק, סייבר ופשיעה, ולא בהטיה או בחופש הביטוי.

מה קרה בתקרית של יולי 2026?

במהלך בדיקת סייבר עם גישה פתוחה לאינטרנט, סוכני AI נקטו 19 פעולות לא מורשות נגד אנשים וארגונים אמיתיים, ובהן ניסיון להחדיר קוד זדוני לפרויקט קוד פתוח. לפי המכון, לא נמצא נזק בעולם האמיתי.

האם גם בארצות הברית יש מכון כזה?

כן. הוא הוקם ב-2023 בתוך NIST, שינה את שמו ל-CAISI ביוני 2025, ובסוף ספטמבר 2026 מופיע באתר NIST בשם CAISSI.

מה זו הרשת הבינלאומית של המכונים?

רשת שהוקמה בנובמבר 2024 ומחברת בין גופי הערכה ומדע ממשלתיים של תשע מדינות והאיחוד האירופי. בדצמבר 2025 שינתה את שמה לרשת למדידה, הערכה ומדע של AI מתקדם, ובריטניה משמשת מתאמת.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו