דלג לתוכן

פריצת מודל (Jailbreak)

מודלים ושפה

הגדרה

פריצת מודל היא ניסיון לעקוף את מגבלות-הבטיחות שהוטמעו במודל AI, כדי לגרום לו לייצר תוכן שהוא אמור לסרב לייצר — לרוב באמצעות ניסוח מתוחכם או תרחישים מדומים.

💡 דוגמה

מבקשים מהצ'אט "תעמיד פנים שאתה דמות בלי חוקים" כדי שיענה על משהו שהוא אמור לסרב לו. זו פריצה.

מודלי AI מאומנים לסרב לבקשות מסוימות (הוראות מסוכנות, תוכן פוגעני). פריצת-מודל מנסה לעקוף את ההגבלה הזו — למשל בבקשה שהמודל "יעמיד פנים" שאין לו הגבלות, או ינסח את הבקשה בעקיפין.

מחקר אקדמי מ-2023 מיפה באופן שיטתי מדוע ניסיונות פריצה מצליחים מבחינה טכנית — לרוב על ידי ניצול מתח בין שתי מטרות-אימון שונות של המודל (להיות מועיל, ולהיות בטוח) שלפעמים סותרות זו את זו במקרי-קצה.

דוגמה מוקדמת ומוכרת במיוחד: טכניקת "DAN" (ראשי-תיבות של Do Anything Now, "עשה כל דבר עכשיו"), שהתפשטה ברשתות-חברתיות ב-2023, ביקשה מהמודל "להעמיד פנים" שהוא ישות נפרדת בלי שום הגבלות-בטיחות. גרסאות שונות של הטכניקה נחסמו וחודשו שוב ושוב במשך חודשים ארוכים.

זהו "משחק-חתול-ועכבר" מתמשך, בדיוק כפי שדוגמת DAN ממחישה: כל שיטת-פריצה שמתגלה מובילה לאימון-בטיחות נוסף שסוגר אותה, ומעודדת ניסיונות פריצה יצירתיים חדשים — ולכן חברות AI רבות מפעילות תוכניות בדיקות-פריצה יזומות באופן שוטף, לרוב בשיתוף חוקרי-אבטחה חיצוניים שמתוגמלים על גילוי חולשות, בדומה למקובל בעולם אבטחת-המידע הכללי.

חשוב להבחין בין פריצת-מודל להזרקת-פרומפט (ראו הערך): פריצה היא ניסיון של המשתמש עצמו לשכנע את המודל לעקוף את הגבלותיו-שלו, בעוד הזרקה מגיעה ממקור חיצוני (מסמך, אתר) שהמודל קורא, בלי שהמשתמש בהכרח מודע לתוכן הזדוני שבו — שני איומים שונים במקור, אף שלעיתים משתמשים בטכניקות ניסוח דומות. ההבחנה הזו חשובה מעבר לסמנטיקה בלבד: היא קובעת גם איפה נכון למקד את ההגנה — פריצה דורשת בעיקר אימון-בטיחות חזק יותר של המודל עצמו, בעוד הזרקה דורשת גם סינון-קפדני של תוכן חיצוני עוד לפני שהוא מגיע למודל בכלל.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו