דלג לתוכן

סינון שיתופי (Collaborative Filtering)

יסודות בינה מלאכותית

הגדרה

סינון שיתופי (Collaborative Filtering) הוא שיטה שמנבאת מה יעניין משתמש לפי ההעדפות של משתמשים רבים אחרים, בעיקר של מי שהטעם שלהם דומה לשלו — בלי לנתח את התוכן עצמו.

💡 דוגמה

מי שקונה באתר ספר מתכונים איטלקי רואה למטה "לקוחות שקנו את זה קנו גם...".

המערכת לא קראה את הספר. היא רק יודעת מה עוד קנו אנשים שקנו אותו.

החוכמה של אנשים דומים

סינון שיתופי (Collaborative Filtering) הוא שיטה לנבא מה יעניין אדם לפי טעמם של אנשים רבים אחרים. לפי ויקיפדיה, הוא אחת משתי הטכניקות המרכזיות של מערכות המלצות, לצד סינון מבוסס-תוכן. ההנחה שבבסיסו פשוטה: אם שני אנשים הסכימו בעבר על דבר אחד, סביר יותר שיסכימו גם על דברים אחרים, לעומת שני אנשים אקראיים.

הדבר המעניין בשיטה הוא מה שהיא לא צריכה. לפי ויקיפדיה, סינון שיתופי טהור אינו נשען על תוכן שהמחשב מנתח, ולכן הוא יכול להמליץ על פריטים מורכבים כמו סרטים בלי "להבין" אותם. בגרסה הטהורה, הוא לא יודע שסרט מסוים הוא קומדיה רומנטית; הוא יודע רק מי צפה בו, מי דירג אותו ומה עוד אהבו אותם אנשים. זה גם ההבדל מדירוג ממוצע פשוט: הניבוי מותאם אישית, אף שהוא נבנה ממידע של משתמשים רבים.

מערכת המלצות היא המוצר — מה שמופיע במסך "מומלץ עבורך". סינון שיתופי הוא אחת השיטות שמפעילות אותו. מערכות רבות משלבות אותו עם שיטות נוספות.

מקבוצות דיון לאמזון

המונח מופיע בכותרת של מאמר שפרסמו גולדברג, ניקולס, אוקי וטרי בכתב העת Communications of the ACM בדצמבר 1992: "שימוש בסינון שיתופי כדי לארוג שטיח של מידע". באותה שנה, לפי ויקיפדיה, התחילו ג'ון רידל ופול רזניק לעבוד על מערכת סינון שיתופי לקבוצות הדיון של Usenet. המערכת, GroupLens, אספה דירוגים מקוראים וניבאה כמה קוראים אחרים יאהבו מאמר עוד לפני שקראו אותו. ויקיפדיה מתארת אותה כאחת המערכות האוטומטיות הראשונות מסוגה. מאמר עליה פורסם בכנס CSCW ב-1994.

באמזון קיבל הרעיון כיוון אחר. לפי ויקיפדיה, הגרסה שמבוססת על פריטים פותחה בה, ופורסמה לראשונה בכנס אקדמי ב-2001. מאמר של גרג לינדן, ברנט סמית' וג'רמי יורק מ-2003, "המלצות Amazon.com: סינון שיתופי פריט-לפריט", נבחר ב-2017 על ידי מערכת כתב העת IEEE Internet Computing כמאמר שעמד הכי טוב במבחן הזמן מבין כל מה שפורסם בו.

משתמש-למשתמש או פריט-לפריט

בשיטות שמבוססות על דמיון בין "שכנים" יש שתי גישות נפוצות. בגישה מבוססת המשתמש, המערכת מחפשת אנשים שדירגו כמו המשתמש הנוכחי, וממליצה על מה שהם אהבו והוא עוד לא ראה. בגישה מבוססת הפריט, שוויקיפדיה מתארת במשפט המוכר "מי שקנה את X קנה גם את Y", המערכת מחשבת מראש אילו פריטים קשורים זה לזה לפי התנהגות הקונים.

באתר Amazon Science הסביר לארי הרדסטי ב-2019 למה אמזון בחרה בדרך השנייה. השוואה ממצה בין לקוחות דורשת לבדוק היסטוריות רכישה מול כל מאגר הלקוחות. אפשר לדגום רק חלק מהלקוחות, אבל אז מוותרים על ההתאמה הטובה ביותר; ואפשר לבנות מראש אינדקס ענק, אבל ההיסטוריות יכולות להשתנות מאוד אפילו ביום אחד, ולכן צריך לעדכן אותו כל הזמן. לעומת זאת, כל מוצר נקנה בממוצע רק בידי חלק קטן מהלקוחות, ולכן הרבה יותר זול לחשב אילו מוצרים קשורים לכל מוצר.

השאלה הקשה הייתה איך מודדים "קשר" בין מוצרים. לפי הכתבה, ספירה פשוטה של מי שקנה גם וגם הייתה הופכת כמה רבי-מכר, כמו ספרי הארי פוטר ושקיות אשפה, להמלצה המובילה לכל לקוח. לכן מוצר ב' נחשב קשור למוצר א' רק אם מי שקנה את א' נוטה לקנות את ב' יותר מהלקוח הממוצע. גם בזה התגלה פגם, שתוקן רק שנים אחר כך: מי שקונה הרבה מוצרים נוטה יותר לקנות גם את א' וגם את ב', והחישוב היה צריך לנכות את ההשפעה הזו.

פרס נטפליקס ופירוק מטריצות

את השלב הבא הניעה תחרות. ב-2 באוקטובר 2006 השיקה נטפליקס את פרס נטפליקס, תחרות פתוחה לאלגוריתם הסינון השיתופי הטוב ביותר לחיזוי דירוגי סרטים. לפי ויקיפדיה, המשתתפים קיבלו 100,480,507 דירוגים שנתנו 480,189 משתמשים ל-17,770 סרטים. ב-21 בספטמבר 2009 הוענק הפרס הגדול, מיליון דולר, לצוות BellKor's Pragmatic Chaos, שהפחית את שגיאת חיזוי הדירוגים ב-10.06% לעומת האלגוריתם של נטפליקס, Cinematch, לפי מדד התחרות. התחזיות נבדקו מול הדירוגים האמיתיים — אמת הקרקע של התחרות — שרק השופטים הכירו.

השיטה שהתפרסמה בזכות התחרות היא פירוק מטריצות (Matrix Factorization). מדמיינים טבלה ענקית — שורה לכל משתמש, עמודה לכל סרט — שרוב התאים בה ריקים. השיטה מפרקת אותה לשתי טבלאות קטנות של "גורמים סמויים": כל משתמש וכל סרט מיוצגים בכמה מספרים, ומהשילוב שלהם מנבאים את הדירוג החסר. לפי ויקיפדיה, הגישה נעשתה מוכרת בזכות פוסט בבלוג שפרסם סיימון פאנק ב-2006, שבו שיתף את ממצאיו עם קהילת החוקרים.

באפריל 2012 כתבו חאבייר אמטריין וג'סטין בסיליקו בבלוג הטכנולוגי של נטפליקס שהחברה הכניסה לשימוש שני אלגוריתמים מתוך הזוכים בפרס הביניים הראשון, ובהם פירוק מטריצות. את השיטות של הזוכה בפרס הגדול בדקו, אבל שיפור הדיוק "לא נראה מצדיק את המאמץ ההנדסי" הנדרש כדי להכניס אותן לשימוש.

הבעיות: התחלה קרה, דלילות ופופולריות

ויקיפדיה מונה כמה חולשות מובנות. הראשונה היא "ההתחלה הקרה" (Cold Start): משתמש חדש צריך לדרג מספיק פריטים לפני שאפשר להמליץ לו, ופריט חדש צריך מספיק מדרגים לפני שאפשר להמליץ עליו. כשיש לפריט חדש תיאור או תכונות ידועות, סינון מבוסס-תוכן יכול להמליץ עליו גם בלי דירוגים. השנייה היא דלילות: בטבלת משתמשים-פריטים גדולה רוב התאים ריקים. יש גם "כבשים אפורות" — משתמשים שהטעם שלהם לא תואם באופן עקבי שום קבוצה, ולכן השיטה לא עוזרת להם.

במערכת שבה כל אחד יכול לדרג, יש גם מי שינסה לרמות: לתת דירוגים גבוהים למוצרים שלו ונמוכים למתחרים. ויש בעיה עדינה יותר — הטיה לטובת מה שכבר פופולרי. לפי ויקיפדיה, מאחר שהשיטה ממליצה לפי מכירות ודירוגים קודמים, קשה לה להמליץ על פריטים עם מעט היסטוריה, וכך עלול להיווצר אפקט שבו העשירים מתעשרים.

לבסוף, פרטיות. נטפליקס פרסמה את נתוני התחרות בלי שמות, אבל לפי ויקיפדיה, ב-2007 הצליחו שני חוקרים מאוניברסיטת טקסס באוסטין, ארווינד נאראיאנן וויטלי שמטיקוב, לזהות משתמשים מסוימים בהשוואה לדירוגים באתר IMDb. במרץ 2010 הודיעה נטפליקס שלא תקיים תחרות שנייה, בעקבות תביעה וחששות פרטיות של רשות הסחר הפדרלית האמריקאית.

סינון שיתופי בעידן הלמידה העמוקה

בשנים האחרונות הוצעו לסינון שיתופי שיטות רבות של רשתות נוירונים. אבל יש גם ביקורת. מאוריציו פרארי דקרמה ושותפיו בדקו ב-2019 שיטות כאלה שהוצגו בכנסים מובילים: מתוך 18 אלגוריתמים, רק 7 הצליחו לשחזר במאמץ סביר, ו-6 מהם, לדבריהם, "לעיתים קרובות" נעקפו על ידי שיטות פשוטות יחסית, כמו שיטות שכנים קרובים.

גם באמזון גילו שחדש אינו בהכרח טוב יותר. לפי דיווח של אמזון עצמה מ-2019 באתר Amazon Science, צוות בהובלת ויג'אי מוהאן שבנה אלגוריתם המלצות לסרטים ב-Prime Video ניסה רשת נוירונים מסוג מקודד אוטומטי (Autoencoder). בניסוי הראשון היא הפסידה לא רק לסינון השיתופי פריט-לפריט, אלא גם לרשימה פשוטה של הסרטים הפופולריים בשבועיים האחרונים. "אם אני לא יודע עליך כלום, הדברים הכי טובים להמליץ לך עליהם הם הדברים הכי פופולריים בעולם", אמר מוהאן. רק אחרי שאימנו את הרשת על נתוני צפייה מסודרים לפי זמן, וביקשו ממנה לנבא את השבועיים הבאים, היא עקפה גם את רשימת הפופולריים וגם את הסינון השיתופי. המדד היה אם לפחות אחת משש ההמלצות לכל לקוח היא סרט שצפה בו בשבועיים הבאים, ולפי אמזון, במדד הזה הרשת הייתה טובה מהסינון השיתופי ביחס של שניים לאחד.

הרעיון הבסיסי — ללמוד מאנשים אחרים מה כדאי להציע לך — לא נעלם. לפי ויקיפדיה, רוב מערכות ההמלצות כיום משתמשות בגישה היברידית, שמשלבת סינון שיתופי עם סינון מבוסס-תוכן ועם שיטות נוספות.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שלוש גישות בסינון שיתופי
מבוסס משתמשמבוסס פריטפירוק מטריצות
השאלה שהמערכת שואלתאילו משתמשים דומים לך, ומה הם אהבו?אילו פריטים קשורים למה שכבר קנית או דירגת?אילו גורמים סמויים מתארים אותך ואת הפריט?
דוגמה מוכרתמערכת גרופלנס, להמלצה על הודעות בקבוצות דיון"מי שקנה את זה קנה גם" באמזוןהשיטות שהתבלטו בפרס נטפליקס
חולשה שמקורות מצייניםהשוואה מול כל המשתמשים יקרה, והפרופילים משתנים מהרפריט חדש צריך מספיק קונים לפני שאפשר להמליץ עליולפי ויקיפדיה, בחלק מהגרסאות משתמש חדש מחייב אימון מחדש

שאלות נפוצות ❓

מה ההבדל בין סינון שיתופי למערכת המלצות?

מערכת המלצות היא המוצר שמציע לכם תוכן או מוצרים. סינון שיתופי הוא אחת השיטות שמפעילות אותה — זו שמסתמכת על ההתנהגות של משתמשים אחרים. לפי ויקיפדיה, רוב מערכות ההמלצות היום משלבות אותו עם שיטות נוספות.

למה לפעמים מקבלים המלצות מוזרות?

כי בגרסה הטהורה השיטה לא מבינה את התוכן, רק את הקשר בין התנהגויות. דפוסי קנייה עשויים ליצור קשר סטטיסטי בין מוצרים, גם בלי קשר תוכני ברור. גם מעט נתונים עליכם, או טעם שלא דומה לאף קבוצה, מובילים להמלצות פחות מדויקות.

מהי בעיית ההתחלה הקרה?

משתמש חדש עוד לא דירג או קנה כלום, ופריט חדש עוד לא נקנה בידי אף אחד. לסינון שיתופי אין על מה להסתמך, ולכן מערכות רבות משלבות בהתחלה המלצות לפי פופולריות או לפי תכונות התוכן.

האם סינון שיתופי פוגע בפרטיות?

הוא נשען על נתוני התנהגות של משתמשים רבים. בתחרות פרס נטפליקס, חוקרים הראו ב-2007 שאפשר לזהות משתמשים מסוימים בנתונים שפורסמו בלי שמות, באמצעות השוואה לדירוגים באתר IMDb.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו