פרס נטפליקס (Netflix Prize)
הגדרה
פרס נטפליקס היה תחרות פתוחה שנטפליקס הכריזה עליה ב-2006: מיליון דולר למי שיפחית ב-10% את שגיאת החיזוי של דירוגי הסרטים שלה. הפרס חולק ב-2009, ונתוני התחרות הפכו גם למקרה מבחן בפרטיות.
💡 דוגמה
מישהו דירג בשמו כמה סרטים באתר IMDb, ובאותם ימים דירג אותם גם בנטפליקס.
חוקרים מטקסס הראו שידיעת כמה דירוגים ותאריכים משוערים כמו אלה יכולה להספיק כדי למצוא את הרשומה שלו ב"נתונים האנונימיים" של התחרות.
מיליון דולר על עשרה אחוזים
פרס נטפליקס (Netflix Prize) היה תחרות פתוחה שנטפליקס השיקה ב-2 באוקטובר 2006. נטפליקס הייתה אז חברה להשכרת תקליטורי DVD דרך האינטרנט, ומערכת ההמלצות שלה, Cinematch, הציעה לכל מנוי סרטים שעשויים למצוא חן בעיניו. לפי הניו יורק טיימס, ב-2008 ההמלצות שלה כבר הניעו כ-60 אחוזים מההשכרות. מי שיצליח לחזות דירוגי סרטים טוב יותר מ-Cinematch, הודיעה החברה, יזכה במיליון דולר.
המטרה הוגדרה במספר אחד. לפי הבלוג הטכנולוגי של נטפליקס, החברה בחרה במדד עקיף שקל למדוד: שגיאת החיזוי של הדירוגים, במדד שנקרא RMSE. כדי לזכות היה צריך להוריד את השגיאה של Cinematch, 0.9525, ל-0.8572 או פחות, כלומר להפחית את השגיאה ב-10%. "להגיע ל-10 אחוזים בהחלט יהיה שווה לחברה הרבה יותר ממיליון דולר", אמר המנכ"ל ריד הייסטינגס לניו יורק טיימס. כל עוד איש לא זכה בפרס הגדול, הוצע מדי שנה פרס התקדמות של 50,000 דולר לתוצאה הטובה ביותר, בתנאי שהשתפרה באחוז לפחות לעומת הזוכה הקודם, או לעומת Cinematch בשנה הראשונה; בלי שיפור כזה, הפרס לא היה מוענק. להשתתף יכול היה כל אחד, חוץ ממי שקשור לנטפליקס ומתושבי כמה מדינות חסומות.
מאה מיליון דירוגים, ומבחן שאי אפשר לראות
המשתתפים קיבלו 100,480,507 דירוגים שנתנו 480,189 מנויים ל-17,770 סרטים. כל דירוג כלל ארבעה פרטים בלבד: מספר מזהה של המנוי, הסרט, תאריך הדירוג ומספר הכוכבים, מאחד עד חמישה. לפי ויקיפדיה, על המנויים עצמם לא נמסר שום מידע, וכדי להגן על פרטיותם חלק מהנתונים שובשו בכוונה: נמחקו דירוגים, נוספו דירוגים ותאריכים חלופיים, ושונו תאריכים.
מנגנון השיפוט נבנה כדי להקשות על התאמת התשובות למבחן. נטפליקס שמרה בצד 2,817,131 דירוגים: המשתתפים קיבלו את המנוי, הסרט והתאריך, אבל לא את מספר הכוכבים, והיו צריכים לחזות אותו. הדירוגים האלה חולקו בסתר לשתי קבוצות כמעט שוות. על קבוצה אחת קיבלו הצוותים ציון גלוי בטבלת המובילים; הציון על הקבוצה השנייה, שלפיה בלבד נקבע הזוכה, נשאר חסוי, ורק השופטים ידעו איזה דירוג שייך לאיזו קבוצה. לפי ויקיפדיה, ההפרדה נועדה להקשות על שיפור חוזר של הציון בניסוי וטעייה על אותם נתוני מבחן.
מירוץ פתוח ובעיית "נפוליאון דינמייט"
התחרות התחילה מהר. לפי ויקיפדיה, כבר ב-8 באוקטובר 2006 עקף צוות בשם WXYZConsulting את Cinematch. לפי הניו יורק טיימס, הפריצה הגדולה הראשונה הגיעה פחות מחודש אחרי הפתיחה, כשצוות בשם Simon Funk קפץ למקום הרביעי עם שיפור של 3.88 אחוזים, בעזרת פירוק לערכים סינגולריים (SVD), טכניקה מתמטית ותיקה שנטפליקס לא חשבה לנסות על סרטים. ביוני 2007 כבר היו רשומים יותר מ-20,000 צוותים מיותר מ-150 מדינות, ובין המובילים המוקדמים היה גם צוות מאוניברסיטת טורונטו בהובלת ג'פרי הינטון.
התחרות הייתה פתוחה במיוחד. לפי הכתבה, צוותים פרסמו קוד בפורום, וכל פריצה של צוות אחד אומצה מהר בידי השאר. ב-2007 זכה בפרס ההתקדמות הראשון צוות KorBell, שלושה חוקרים ממעבדות AT&T: יהודה קורן, רוברט בל וכריס וולינסקי, עם שיפור של 8.43%. לפי הבלוג של נטפליקס, הם דיווחו על יותר מ-2,000 שעות עבודה ועל שילוב של 107 אלגוריתמים.
ככל שהתקרבו לעשרה אחוזים, ההתקדמות נעשתה איטית. הניו יורק טיימס תיאר ב-2008 את "בעיית נפוליאון דינמייט": בלהיטים רגילים היה המתחרה לן ברטוני בדרך כלל בטווח של שמונה עשיריות כוכב מהדירוג האמיתי, אבל בקומדיה המקטבת הזאת, שרבים מדרגיה נתנו לה כוכב אחד או חמישה, הוא טעה בממוצע ב-1.2 כוכבים. לפי חישוביו, הסרט הזה לבדו גרם ל-15 אחוזים מהשגיאה שנותרה לו. גם "אבודים בטוקיו" ו"פרנהייט 9/11" הופיעו ברשימת הסרטים הקשים לחיזוי שלו.
ניצחון בהפרש של עשרים דקות
ב-2008 זכה BellKor בפרס ההתקדמות השני, הפעם בשיתוף עם הצוות האוסטרי BigChaos, בשילוב של 207 סטים של תחזיות. ב-26 ביוני 2009 עבר צוות מאוחד חדש, BellKor's Pragmatic Chaos, את רף עשרת האחוזים, וזה פתח "קריאה אחרונה" של 30 יום לכל השאר. ב-25 ביולי עקף אותו בטבלה הגלויה צוות מתחרה בשם The Ensemble. ההכרעה נפלה על הקבוצה החסויה: שם השיגו שני הצוותים תוצאה זהה, ולפי הכללים זכה מי שהגיש קודם. BellKor's Pragmatic Chaos הגיש 20 דקות לפני המתחרים, והפרס הוענק לו בטקס ב-21 בספטמבר 2009. בטבלה הסופית נספרו 44,014 הגשות של 5,169 צוותים.
הפתרון המנצח לא היה אלגוריתם אחד, אלא שקלול של מאות מודלים, שיטה שנקראת למידת אנסמבל. אבל לפי הבלוג הטכנולוגי של נטפליקס מ-2012, החברה הכניסה לשימוש דווקא שני אלגוריתמים מפרס ההתקדמות הראשון: פירוק מטריצות ומכונות בולצמן מוגבלות. חלק מהשיטות החדשות של הזוכה בפרס הגדול היא בדקה בניסויים מחוץ לסביבת הייצור, אבל שיפור הדיוק שמדדה "לא נראה מצדיק את המאמץ ההנדסי" הנדרש. בינתיים, הסבירה, השתנתה גם נטפליקס עצמה: היא עברה מהשכרת DVD בארצות הברית לסטרימינג עולמי.
הנתונים האנונימיים שלא היו אנונימיים
באוקטובר 2006 פרסמו ארווינד נאראיאנן וויטלי שמטיקוב מאוניברסיטת טקסס באוסטין גרסה ראשונה של מאמר בשם "How To Break Anonymity of the Netflix Prize Dataset". הם הראו שמי שיודע מעט מאוד על מנוי יכול לאתר את הרשומה שלו בנתונים. בגרסה המורחבת של המאמר, מנובמבר 2007, דיווחו שבניסוי שערכו, שמונה דירוגים, ששניים מהם אפילו שגויים לגמרי, ותאריכים עם טעות של עד 14 יום, מספיקים כדי לזהות באופן חד-ערכי 99% מהרשומות; ול-68% מהרשומות מספיקים שני דירוגים ותאריכים עם טעות של עד שלושה ימים.
באותה גרסה הוסיפו הדגמה: הם השוו את הנתונים לדירוגים שאנשים פרסמו בשמם באתר IMDb. הם עבדו, לדבריהם, עם מדגם קטן מאוד של כמה עשרות משתמשים בלבד, כ"הוכחת היתכנות". ובכל זאת זיהו את הרשומות של שניים מהם, וחשפו העדפות פוליטיות משתמעות ומידע רגיש נוסף. החוקרים הדגישו שאין להסיק מכך איזה שיעור ממשתמשי IMDb אפשר לזהות. לפי Wired, המשפטן פול אום הגיע במאמר משפטי למסקנה שאם נתונים שימושיים לחוקרים, הם גם ניתנים, מעצם הגדרתם, לזיהוי מחדש.
ההמשך שבוטל
ב-6 באוגוסט 2009 הכריזה נטפליקס על תחרות המשך. לפי ויקיפדיה, הפעם היו המשתתפים אמורים לקבל גם נתונים דמוגרפיים, ובהם גיל, מגדר ומיקוד, ו-500,000 דולר היו אמורים להינתן לצוות המוביל אחרי חצי שנה, ועוד 500,000 למוביל אחרי שנה וחצי. פול אום כינה את הרעיון "טעות פרטיות שעלולה לעלות מיליוני דולרים בקנסות ובפיצויים".
ב-17 בדצמבר 2009 הוגשה נגד נטפליקס תביעה ייצוגית. לפי Wired, אחת התובעות הייתה אם לסבית שלא יצאה מהארון, שטענה שהנתונים מהתחרות עלולים לחשוף את נטייתה המינית. התביעה נשענה בין השאר על חוק פדרלי שמגן על רשומות של השכרת וידאו, וביקשה גם לעצור את תחרות ההמשך. ב-12 במרץ 2010 הודיע מנהל המוצר הראשי של נטפליקס, ניל האנט, שרשות הסחר הפדרלית האמריקאית (FTC) שאלה את החברה איך תחרות המשך תשפיע על פרטיות המנויים, ושהחברה הגיעה להבנה עם הרשות והסדירה את התביעה בפשרה. "החלטנו לא להמשיך בפרס נטפליקס ההמשכי שהכרזנו עליו", כתב.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| פרס ההתקדמות 2007 | פרס ההתקדמות 2008 | הפרס הגדול 2009 | |
|---|---|---|---|
| הצוות הזוכה | צוות KorBell (לשעבר BellKor) ממעבדות AT&T | צוות BellKor יחד עם הצוות האוסטרי BigChaos | צוות מאוחד בשם BellKor's Pragmatic Chaos |
| סכום | 50,000 דולר | 50,000 דולר | מיליון דולר |
| שגיאת החיזוי (RMSE) | 0.8712 | 0.8616 | שגיאה במבחן החסוי: 0.8567 |
| פרט בולט | שילוב של 107 אלגוריתמים | שילוב של 207 סטים של תחזיות | הוגש 20 דקות לפני צוות שהשיג תוצאה זהה |
שאלות נפוצות ❓
מי זכה בפרס נטפליקס?
צוות BellKor's Pragmatic Chaos, שאיחד שלושה צוותים: BellKor, BigChaos ו-Pragmatic Theory. הוא קיבל מיליון דולר ב-21 בספטמבר 2009, אחרי שהפחית את שגיאת החיזוי ב-10.06% לעומת Cinematch.
האם נטפליקס השתמשה באלגוריתם הזוכה?
לא במלואו. לפי הבלוג הטכנולוגי שלה, היא הכניסה לשימוש שני אלגוריתמים מפרס ההתקדמות של 2007, פירוק מטריצות ומכונות בולצמן מוגבלות. חלק משיטות הזוכה בפרס הגדול בדקה מחוץ לסביבת הייצור, אבל שיפור הדיוק לא נראה לה מצדיק את המאמץ ההנדסי.
איך זוהו מנויים בנתונים שפורסמו בלי שמות?
החוקרים נאראיאנן ושמטיקוב השוו את דירוגי הסרטים ותאריכיהם לדירוגים שאנשים פרסמו בשמם באתר IMDb. בהדגמה הזו זוהו שני משתמשים. בניסוי נפרד ומבוקר דיווחו החוקרים ששמונה דירוגים עם תאריכים משוערים הספיקו לזיהוי חד-ערכי של 99% מהרשומות.
למה בוטלה התחרות השנייה?
בעקבות תביעה ייצוגית בטענה לפגיעה בפרטיות ופנייה של רשות הסחר הפדרלית האמריקאית. במרץ 2010 הודיעה נטפליקס שהגיעה להבנה עם הרשות, הסדירה את התביעה ולא תקיים את תחרות ההמשך.