פרטיות דיפרנציאלית (Differential Privacy)

בטיחות ואתיקה

הגדרה

פרטיות דיפרנציאלית היא מסגרת מתמטית לפרסום סטטיסטיקה על מאגר נתונים, שמזריקה רעש מכויל כך שלא ניתן ללמוד מהפלט אם אדם מסוים נכלל במאגר או לא.

מה בדיוק מובטח כאן

פרטיות דיפרנציאלית היא מסגרת מתמטית לפרסום מידע סטטיסטי על מאגר נתונים תוך הגנה על פרטיות האנשים שבתוכו: היא מאפשרת לחשוף דפוסים קבוצתיים ומגבילה את המידע שמצביע על יחיד. בגסות, אלגוריתם עומד בה אם מי שרואה את הפלט אינו יכול לדעת אם המידע של אדם מסוים שימש בחישוב. בניסוח מדויק יותר, שינוי של רשומה אחת במאגר משנה רק במעט את התפלגות הפלט — כך שכל אדם מקבל בקירוב את אותה פרטיות שהייתה לו אילו נתוניו לא היו במאגר כלל.

2006, וזווית ישראלית

ב-2003 הראו קובי נסים ואירית דינור שאי-אפשר לפרסם שאילתות שרירותיות על מאגר סטטיסטי בלי לחשוף מידע פרטי כלשהו, ושכל תוכן המאגר ניתן לשחזור ממספר קטן להפתיע של שאילתות אקראיות — עיקרון שהתקבע בשם החוק היסודי של שחזור מידע, ושהמסקנה ממנו היא שאין הגנה בלי הזרקת רעש. ב-2006 פרסמו סינתיה דוורק, פרנק מק'שרי, קובי נסים ואדם סמית' את המאמר Calibrating Noise to Sensitivity in Private Data Analysis, שנתן לרעיון את הגדרתו הפורמלית הראשונה; העבודה זיכתה אותם בפרס גדל ב-2017. נסים, יליד ישראל ובוגר מכון ויצמן, מכהן היום כפרופסור באוניברסיטת ג'ורג'טאון שבארצות הברית.

אפסילון: קטן יותר פירושו הגנה חזקה יותר

עוצמת ההגנה נשלטת בפרמטר יחיד, אפסילון, שמכונה גם תקציב הפרטיות. הכיוון שלו מבלבל רבים: לפי NIST, ערכים קטנים יותר של אפסילון מספקים פרטיות טובה יותר, וערכים גדולים יותר — פרטיות גרועה יותר. כשהפרמטר מכוון לטובת תועלת מוזרק פחות רעש והפרטיות נשחקת; כשהוא מכוון לטובת פרטיות מוזרק יותר רעש והדיוק נפגע. ככל שהשאילתה נוגעת לפחות אנשים יש להוסיף יותר רעש כדי להשיג את אותה מידת פרטיות — מכאן שם המאמר מ-2006. וזה תקציב שנצרך: הפעלת מנגנון כזה t פעמים, כשהאקראיות עצמאית בכל פעם, מניבה יחד הגנה של אפסילון כפול t.

אילו ערכים בוחרים בפועל

לפי סקירת NIST מ-2022 אין עדיין תשובה מוסכמת לשאלה מה בדיוק אומר אפסילון וכיצד ראוי לקבוע אותו. חוקרים המליצו על ערכים סביב 1, אך פריסות ממשיות הציבו ערכים גבוהים יותר: NIST מציין שמערכת הפרטיות הדיפרנציאלית של Apple משתמשת בערכי אפסילון שבין 2 ל-16 למשתמש ליום, ושלשכת המפקד האמריקאית תכננה אפסילון של 19.61 לנתוני חלוקת המחוזות של מפקד 2020. NIST מוסיף כי חרף חששות אקדמיים, אף אחת מהמערכות האלה טרם הייתה יעד להתקפת פרטיות מוצלחת — בניגוד למערכות המבוססות על הסרת מזהים, שנפרצו שוב ושוב.

היכן זה פרוס, ומה עדיין פתוח

מתועדות יותר מתריסר פריסות ממשיות, ובהן RAPPOR של Google ב-2014 לאיסוף טלמטריה, iOS 10 של Apple ב-2016, טלמטריה של Microsoft ב-Windows ב-2017, ולשכת המפקד האמריקאית — ב-2008 להצגת דפוסי נסיעה לעבודה, וב-2021 לפרסום נתוני חלוקת המחוזות של מפקד 2020. שתי מגבלות בולטות. הראשונה: ההבטחה תלויה כולה בערך שנבחר לאפסילון, ולכן היא עלולה ליצור תחושת ביטחון מוטעית. השנייה: המימוש רץ על מחשב אמיתי ולכן חשוף לתקיפות שאינן מתמטיות — ערוצי צד מבוססי תזמון, ודליפה דרך אריתמטיקת נקודה צפה, שבמימוש נאיבי של מנגנון לפלס פוגמת בהבטחה עצמה.

שאלות נפוצות ❓

מה בדיוק מבטיחה פרטיות דיפרנציאלית?

שמי שרואה את הפלט של החישוב לא יוכל לדעת אם המידע של אדם מסוים שימש בו. שינוי של רשומה אחת במאגר משנה רק במעט את התפלגות הפלט, כך שכל אדם מקבל בקירוב את אותה פרטיות שהייתה לו אילו נתוניו לא היו במאגר כלל.

מהו אפסילון, ולאיזה כיוון הוא עובד?

אפסילון הוא הפרמטר שקובע את עוצמת ההגנה, ומכונה גם תקציב הפרטיות. הכיוון מבלבל רבים: לפי NIST, ערכים קטנים יותר של אפסילון מספקים פרטיות טובה יותר, וערכים גדולים יותר — פרטיות גרועה יותר. כיוונון לטובת פרטיות מזריק יותר רעש ופוגע בדיוק; כיוונון לטובת תועלת מזריק פחות רעש ושוחק את הפרטיות.

מי פיתח את השיטה, ומה הזווית הישראלית?

המאמר שנתן להגדרה את צורתה הפורמלית הראשונה פורסם ב-2006 בידי סינתיה דוורק, פרנק מק'שרי, קובי נסים ואדם סמית', וזיכה אותם בפרס גדל ב-2017. נסים הוא יליד ישראל ובוגר מכון ויצמן, ומכהן היום כפרופסור באוניברסיטת ג'ורג'טאון שבארצות הברית — כלומר הזיקה הישראלית היא בביוגרפיה ובהכשרה, לא במוסד שבו הוא עובד כיום.

אילו ערכי אפסילון משמשים במערכות אמיתיות?

חוקרים המליצו על ערכים סביב 1, אך פריסות ממשיות גבוהות יותר. NIST מציין בסקירתו מ-2022 את מערכת הפרטיות הדיפרנציאלית של Apple, המשתמשת בערכים שבין 2 ל-16 למשתמש ליום, ואת לשכת המפקד האמריקאית, שתכננה אפסילון של 19.61 לנתוני חלוקת המחוזות של מפקד 2020 — נתונים שפורסמו בשיטה הזו ב-2021. לפי NIST אין עדיין תשובה מוסכמת לשאלה כיצד ראוי לקבוע את הערך.

מה המגבלות של הגישה?

שתיים בולטות. ראשית, כל עוצמת ההבטחה תלויה בערך שנבחר לאפסילון, ולכן היא עלולה ליצור תחושת ביטחון מוטעית. שנית, המימוש רץ על מחשב אמיתי וחשוף לתקיפות שאינן מתמטיות — למשל ערוצי צד מבוססי תזמון, או דליפה דרך אריתמטיקת נקודה צפה, שבמימוש נאיבי של מנגנון לפלס פוגמת בהבטחה עצמה.