התקפה יריבה (Adversarial Attack)
הגדרה
התקפה יריבה היא שינוי קטן ומחושב-בקפידה בקלט (למשל תמונה) שגורם למודל AI לטעות בגדול — שינוי כל-כך עדין שעין אנושית כמעט לא מבחינה בו.
תוקף מוסיף "רעש" מחושב-מתמטית לתמונה — למשל של תמרור-עצור — כדי שהמודל יזהה אותו בטעות כתמרור-אחר לגמרי, בעוד שלעין אנושית התמונה נראית זהה-כמעט-לחלוטין למקור. השינוי לא אקראי: הוא מחושב במכוון כדי לדחוף את הקלט בדיוק מעבר לגבול-ההחלטה הפנימי של המודל, לכיוון הסיווג השגוי שהתוקף רוצה. תופעה זו קיימת גם בתמונות, גם בטקסט וגם בקול — בכל תחום שבו מודל-AI מקבל החלטה על סמך קלט רציף שאפשר לשנות אותו בעדינות.
התחום התחיל להיחקר ברצינות במחקר-אקדמי כבר ב-2004, בכנס ה-MIT Spam Conference, שבו הודגמו לראשונה שיטות להערים על מסנני-דואר-זבל. מ-2012 עד 2014 הראו מחקרים שגם רשתות-נוירונים-עמוקות — לא רק סיווגים סטטיסטיים פשוטים-יותר — פגיעות באותו אופן, וממש דומה, בפני התקפות מבוססות-גרדיאנט — תגלית שהפתיעה חלק מהחוקרים, כי דווקא רשתות-עמוקות נחשבו עד-אז מדויקות-מספיק כדי להיות עמידות יותר, לא פחות.
התקפות כאלה עובדות גם בעולם הפיזי, לא רק על קבצי-תמונה דיגיטליים: מחקר של חברת-האבטחה McAfee תקף מערכת מבוססת-Mobileye (חברה ישראלית, ספק-הטכנולוגיה שסיפקה אז את מערכת-הראייה-הממוחשבת בדגמים מסוימים של טסלה) — הדבקת רצועת-סלוטייפ שחורה ברוחב שתי-אינץ' על תמרור-מהירות גרמה למערכת לפרש אותו כתמרור עם מגבלת-מהירות גבוהה משמעותית, מה שהאיץ את הרכב לנסיעה מהירה-הרבה-יותר מהמותר.
התקפות יריבות חושפות פגיעות מדאיגה: מודלים "חכמים" מאוד יכולים להתבלבל משינוי זעיר שבן-אדם לא היה שם-לב אליו כלל — נושא מחקר קריטי לפני פריסת AI במערכות בטיחותיות כמו רכב-אוטונומי. הגנה נפוצה, "אימון-יריב" (Adversarial Training), מזינה למודל בכוונה דוגמאות-יריבות במהלך האימון עצמו, כדי שילמד לזהות אותן — אבל גם זו לא הגנה מושלמת, רק העלאת-רף שהופכת התקפה לקשה-יותר, לא בלתי-אפשרית — מרוץ-חימוש מתמשך בין תוקפים ומגנים, לא בעיה שנפתרת פעם-אחת ולתמיד.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות