סיווג בייסיאני נאיבי (Naive Bayes Classifier)

יסודות בינה מלאכותית

הגדרה

סיווג בייסיאני נאיבי (Naive Bayes Classifier) הוא משפחת אלגוריתמי-סיווג הסתברותיים המבוססים על חוק בייס, בהנחה מפשטת שכל התכונות של דוגמה בלתי-תלויות זו בזו.

Naive Bayes Classifier הוא שם כולל למשפחה של אלגוריתמי-סיווג הסתברותיים, המשמשים במשימות כמו סיווג-טקסט וסינון-דואר-זבל. השם "נאיבי" מתייחס להנחה המפשטת שביסוד השיטה: שכל תכונה של דוגמה מסוימת (למשל, כל מילה בהודעת-דואר) תורמת להסתברות-הסיווג באופן בלתי-תלוי לחלוטין בשאר התכונות — הנחה שכמעט אף פעם אינה נכונה באמת בעולם האמיתי, אך למרבה ההפתעה, המסווג ממשיך לתפקד היטב גם כשההנחה הזו מופרת בפועל.

בניגוד לרבים מאלגוריתמי למידת-המכונה הקלאסיים, ל-Naive Bayes אין ממציא בודד מוגדר ותאריך-לידה חד-משמעי. השיטה מבוססת על חוק בייס, שפורסם ב-1763 לאחר מותו של תומאס בייס, אך יישומה כמסווג-הסתברותי-פשוט לטקסט צמח בהדרגה מתוך מחקר באחזור-מידע: כבר ב-1961 פרסם מ.א. מרון (M.E. Maron), בכתב-העת Journal of the ACM, שיטת-אינדוקס אוטומטית מבוססת-הסתברות שהניחה אי-תלות בין מילים — רעיון-הליבה של Naive Bayes, גם אם לא תחת השם הזה.

השיטה הופיעה בהמשך בספרי-לימוד קלאסיים על זיהוי-תבניות בשנות ה-70, ולאורך שנות ה-90 של המאה ה-20 זכתה לתשומת-לב רחבה בזכות ביצועיה המפתיעים-טובים במשימת סינון-דואר-זבל, אף שההנחה שביסודה פשטנית. מאמר מ-1998 בשם "Naive (Bayes) at Forty", שסקר ארבעה עשורי-מחקר על השיטה בתחום אחזור-המידע, משקף את הדרך הארוכה והמפוזרת שבה השיטה התפתחה — לא דרך פריצת-דרך בודדת, אלא מחקר מצטבר של חוקרים רבים לאורך עשרות שנים.

היתרון המעשי המרכזי של Naive Bayes הוא פשטות ומהירות: האימון דורש רק ספירת-תדירויות, ללא צורך באופטימיזציה איטרטיבית מורכבת כמו ברשתות-נוירונים, מה שהופך אותו למתאים במיוחד למאגרי-נתונים גדולים או למשאבי-חישוב מוגבלים. הוא נשאר בשימוש נפוץ כשלב-בסיס (Baseline) שאיתו משווים מודלים מתוחכמים יותר, וכשיטה עצמאית לגיטימית במשימות כמו סיווג-רגשות (Sentiment Analysis) וסינון-דואר-זבל, גם היום.