מה בדיוק מובטח כאן
פרטיות דיפרנציאלית היא מסגרת מתמטית לפרסום מידע סטטיסטי על מאגר נתונים תוך הגנה על פרטיות האנשים שבתוכו: היא מאפשרת לחשוף דפוסים קבוצתיים ומגבילה את המידע שמצביע על יחיד. בגסות, אלגוריתם עומד בה אם מי שרואה את הפלט אינו יכול לדעת אם המידע של אדם מסוים שימש בחישוב. בניסוח מדויק יותר, שינוי של רשומה אחת במאגר משנה רק במעט את התפלגות הפלט — כך שכל אדם מקבל בקירוב את אותה פרטיות שהייתה לו אילו נתוניו לא היו במאגר כלל.
2006, וזווית ישראלית
ב-2003 הראו קובי נסים ואירית דינור שאי-אפשר לפרסם שאילתות שרירותיות על מאגר סטטיסטי בלי לחשוף מידע פרטי כלשהו, ושכל תוכן המאגר ניתן לשחזור ממספר קטן להפתיע של שאילתות אקראיות — עיקרון שהתקבע בשם החוק היסודי של שחזור מידע, ושהמסקנה ממנו היא שאין הגנה בלי הזרקת רעש. ב-2006 פרסמו סינתיה דוורק, פרנק מק'שרי, קובי נסים ואדם סמית' את המאמר Calibrating Noise to Sensitivity in Private Data Analysis, שנתן לרעיון את הגדרתו הפורמלית הראשונה; העבודה זיכתה אותם בפרס גדל ב-2017. נסים, יליד ישראל ובוגר מכון ויצמן, מכהן היום כפרופסור באוניברסיטת ג'ורג'טאון שבארצות הברית.
אפסילון: קטן יותר פירושו הגנה חזקה יותר
עוצמת ההגנה נשלטת בפרמטר יחיד, אפסילון, שמכונה גם תקציב הפרטיות. הכיוון שלו מבלבל רבים: לפי NIST, ערכים קטנים יותר של אפסילון מספקים פרטיות טובה יותר, וערכים גדולים יותר — פרטיות גרועה יותר. כשהפרמטר מכוון לטובת תועלת מוזרק פחות רעש והפרטיות נשחקת; כשהוא מכוון לטובת פרטיות מוזרק יותר רעש והדיוק נפגע. ככל שהשאילתה נוגעת לפחות אנשים יש להוסיף יותר רעש כדי להשיג את אותה מידת פרטיות — מכאן שם המאמר מ-2006. וזה תקציב שנצרך: הפעלת מנגנון כזה t פעמים, כשהאקראיות עצמאית בכל פעם, מניבה יחד הגנה של אפסילון כפול t.
אילו ערכים בוחרים בפועל
לפי סקירת NIST מ-2022 אין עדיין תשובה מוסכמת לשאלה מה בדיוק אומר אפסילון וכיצד ראוי לקבוע אותו. חוקרים המליצו על ערכים סביב 1, אך פריסות ממשיות הציבו ערכים גבוהים יותר: NIST מציין שמערכת הפרטיות הדיפרנציאלית של Apple משתמשת בערכי אפסילון שבין 2 ל-16 למשתמש ליום, ושלשכת המפקד האמריקאית תכננה אפסילון של 19.61 לנתוני חלוקת המחוזות של מפקד 2020. NIST מוסיף כי חרף חששות אקדמיים, אף אחת מהמערכות האלה טרם הייתה יעד להתקפת פרטיות מוצלחת — בניגוד למערכות המבוססות על הסרת מזהים, שנפרצו שוב ושוב.
היכן זה פרוס, ומה עדיין פתוח
מתועדות יותר מתריסר פריסות ממשיות, ובהן RAPPOR של Google ב-2014 לאיסוף טלמטריה, iOS 10 של Apple ב-2016, טלמטריה של Microsoft ב-Windows ב-2017, ולשכת המפקד האמריקאית — ב-2008 להצגת דפוסי נסיעה לעבודה, וב-2021 לפרסום נתוני חלוקת המחוזות של מפקד 2020. שתי מגבלות בולטות. הראשונה: ההבטחה תלויה כולה בערך שנבחר לאפסילון, ולכן היא עלולה ליצור תחושת ביטחון מוטעית. השנייה: המימוש רץ על מחשב אמיתי ולכן חשוף לתקיפות שאינן מתמטיות — ערוצי צד מבוססי תזמון, ודליפה דרך אריתמטיקת נקודה צפה, שבמימוש נאיבי של מנגנון לפלס פוגמת בהבטחה עצמה.