הגנה ותקיפה בסייבר בעזרת בינה מלאכותית (AI in Cyber Defense and Offense)

AI יישומי

הגדרה

הגנה ותקיפה בסייבר בעזרת בינה מלאכותית הן שני צדדים של אותה יכולת: מודלי שפה שמאתרים חולשות בקוד ומנתחים התראות משמשים גם תוקפים להאצת פריצות.

שני צדדים לאותה יכולת

אבטחת מידע היא תחום ותיק עם פרקטיקות מבוססות להגנה ולתקיפה, והבינה המלאכותית היוצרת נכנסת לשני הצדדים שלו בבת אחת. מסגרת NIST לניהול סיכונים של בינה מלאכותית יוצרת (NIST AI 600-1, יולי 2024) מתארת שני סיכונים עיקריים: הורדת החסמים לפעולות תקיפה, כולל גילוי וניצול אוטומטי של חולשות, והרחבת שטח התקיפה, משום שהמערכות עצמן פגיעות להזרקת פרומפט ולהרעלת נתונים. לפי המסגרת, כבר דווח שמודלי שפה מסוגלים לגלות חלק מהחולשות במערכות ולכתוב קוד שמנצל אותן. אותה יכולת בדיוק היא מה שמגינים מנסים לרתום כדי למצוא את החולשות ראשונים.

צד ההגנה: למצוא חולשות לפני התוקף

פרויקט Big Sleep, שיתוף פעולה של Google Project Zero ו-Google DeepMind, דיווח בתחילת אוקטובר 2024 למפתחי מסד הנתונים הפתוח SQLite על חולשת זיכרון ניתנת לניצול שסוכן מבוסס מודל שפה מצא בקוד. המפתחים תיקנו אותה באותו יום, לפני שהגיעה לגרסה רשמית. הצוות הגדיר זאת כדוגמה הפומבית הראשונה לסוכן בינה מלאכותית שמצא חולשה כזו, שלא הייתה ידועה, בתוכנה נפוצה, וציין שכלי הבדיקה האוטומטיים הקיימים של SQLite לא מצאו אותה. באוגוסט 2025 הסתיימה תחרות AI Cyber Challenge של DARPA, שבה בנו צוותים מערכות אוטונומיות לאיתור חולשות ולתיקונן. בגמר גילו המערכות 54 חולשות מלאכותיות ייחודיות ב-63 אתגרים ותיקנו 43 מהן, ומצאו גם 18 חולשות אמיתיות. הצוות Team Atlanta זכה במקום הראשון, ביום ההכרזה שוחררו ארבע מתוך שבע המערכות כקוד פתוח, ו-DARPA הודיעה שהשאר ישוחררו בשבועות שאחריו.

ניתוח התראות: איפה המודל עוזר ואיפה לא

מרכזי ניטור אבטחה מתמודדים עם כמויות גדולות של התראות, עד כדי שחיקה של האנליסטים שבודקים אותן. מחקר שפורסם ב-2026 בכתב העת Expert Systems with Applications בחן שמונה מודלי שפה כלליים של OpenAI, DeepSeek ו-Ai2 על 178 התראות שסווגו ידנית: המודלים התבקשו להבחין בין התראה אמיתית להתרעת שווא ולדרג את חומרתה. כמה מהמודלים זיהו היטב התראות אמיתיות, אבל מודלים פשוטים של למידת מכונה הגיעו לתוצאות דומות ולעיתים טובות יותר, ומודל SVM ליניארי השיג את ציון ה-F1 הגבוה ביותר. דירוג החומרה התגלה כקשה בהרבה לכל המודלים, והדיוק הנמוך בו הוסיף רעש והתרעות שווא. מסקנת החוקרים: המודלים יכולים לסייע באבחון ראשוני, אבל האמינות שלהם בדירוג עדיין מוגבלת.

צד התקיפה: מה תועד בפועל

ב-13 בנובמבר 2025 פרסמה Anthropic דיווח על קמפיין ריגול שזיהתה באמצע ספטמבר 2025 ושייחסה, ברמת ביטחון גבוהה לדבריה, לקבוצה במימון המדינה הסינית. התוקפים הפעילו את Claude Code במסגרת תקיפה אוטומטית נגד כשלושים יעדים והצליחו במספר קטן של מקרים. כדי לעקוף את מנגנוני הבטיחות הם פירקו את התקיפה למשימות קטנות שנראו תמימות, ואמרו למודל שהוא עובד של חברת אבטחה לגיטימית שמבצעת בדיקות הגנה. לפי הדיווח, הבינה המלאכותית ביצעה 80% עד 90% מהקמפיין, ובני אדם התערבו רק בכ-4 עד 6 נקודות החלטה קריטיות. זו הערכה של החברה שהמודל שלה נוצל, לא ממצא של גוף בלתי תלוי.

הערכת מצב ממשלתית

המרכז הלאומי לאבטחת סייבר של בריטניה (NCSC) פרסם ב-7 במאי 2025 הערכה לגבי ההשפעה עד 2027. לפיה, הבינה המלאכותית כמעט בוודאות תמשיך לייעל חלקים מפעולות החדירה ותגביר את תדירות האיומים ועוצמתם, וההשפעה המשמעותית ביותר צפויה בסיוע למחקר חולשות ולפיתוח כלי ניצול. הזמן בין פרסום חולשה לניצולה כבר התקצר לימים, והבינה המלאכותית צפויה לקצר אותו עוד. באותה הערכה קבע המרכז שתקיפות מתקדמות אוטומטיות לחלוטין, מקצה לקצה, אינן סבירות עד 2027, ושתוקפים מיומנים יצטרכו להישאר מעורבים. עוד צפה המרכז פער דיגיטלי בין מערכות שיעמדו בקצב האיומים לבין חלק גדול מהמערכות שיהיו פגיעות יותר.

עין אנושית ומדדי שגיאה

בכל המקורות האלה המודל אינו פועל בלי טעויות. בדיווח של Anthropic המודל המציא לפעמים פרטי התחברות, או טען שהשיג מידע סודי שהיה בעצם פומבי, והחברה מציינת שזה עדיין מכשול לתקיפות אוטונומיות לחלוטין. בתחרות של DARPA ניקוד המערכות הביא בחשבון את שיעור ההגשות המדויקות, ולא רק את מספרן. במחקר על ניתוח התראות, דירוג החומרה הוסיף התרעות שווא. מסגרת NIST מונה בין הסיכונים גם תלות-יתר של בני אדם במערכת. לכן כל מספר כאן שייך להקשר שבו נמדד — אתגרים מלאכותיים, מאגר התראות מסוים או קמפיין אחד — ואינו מתאר את ביצועי התחום כולו.

שאלות נפוצות ❓

האם בינה מלאכותית כבר מבצעת תקיפות סייבר בעצמה?

Anthropic דיווחה בנובמבר 2025 על קמפיין ריגול שבו, לפי הערכתה, הבינה המלאכותית ביצעה 80% עד 90% מהעבודה ובני אדם התערבו בכ-4 עד 6 נקודות החלטה. המרכז הבריטי NCSC העריך במאי 2025 שתקיפות מתקדמות אוטומטיות לחלוטין אינן סבירות עד 2027.

איך בינה מלאכותית עוזרת למגינים?

בעיקר באיתור חולשות לפני שתוקפים מוצאים אותן. Big Sleep של Google מצא ב-2024 חולשה ב-SQLite שתוקנה לפני שהגיעה לגרסה רשמית, ובגמר תחרות AI Cyber Challenge של DARPA ב-2025 גילו מערכות אוטונומיות 54 חולשות מלאכותיות ייחודיות, תיקנו 43 מהן ומצאו גם 18 חולשות אמיתיות.

האם מודל שפה יכול למיין התראות אבטחה?

באופן חלקי. במחקר מ-2026 על 178 התראות, כמה מודלים זיהו היטב התראות אמיתיות, אבל מודלים פשוטים של למידת מכונה השתוו אליהם ולעיתים עקפו אותם, ודירוג החומרה נשאר קשה לכל המודלים.

במה הערך הזה שונה מהערך על בינה מלאכותית באבטחת סייבר?

הערך בינה מלאכותית באבטחת סייבר עוסק בזיהוי חריגות ברשת ובבעיית התרעות השווא. כאן העיסוק הוא בשימוש הכפול במודלי שפה — איתור חולשות ותיקונן מצד אחד, ותקיפות שמבוצעות בעזרת סוכנים מצד שני.

למה אי אפשר לסמוך על המספרים כמדד כללי?

כי כל אחד מהם נמדד בהקשר צר: תחרות על חולשות מלאכותיות, מאגר של 178 התראות או קמפיין אחד שדווח על ידי החברה שהמודל שלה נוצל. מסגרת NIST מזהירה גם מתלות-יתר של בני אדם בפלט של המערכת.