דלג לתוכן

סיווג (Classification)

יסודות בינה מלאכותית

הגדרה

סיווג הוא משימת למידה-מפוקחת שבה המודל צריך לשייך כל דוגמה לאחת מכמה קטגוריות מוגדרות-מראש — למשל "ספאם" או "לא ספאם", "חתול" או "כלב".

💡 דוגמה

תיבת הדואר מחליטה לבד: "ספאם" או "לא ספאם". זה סיווג. מודל אחר מחליט אם בתמונה יש חתול או כלב.

בסיווג, המודל לומד מדוגמאות מתויגות (כל אחת עם קטגוריה נכונה ידועה) איך להכריע לאיזו קטגוריה שייכת דוגמה חדשה שהוא לא ראה מעולם. זו אחת המשימות הבסיסיות והנפוצות ביותר בלמידת-מכונה.

סיווג יכול להיות בינארי (שתי אפשרויות בלבד, כמו "ספאם"/"לא ספאם") או רב-מחלקתי (הרבה קטגוריות אפשריות, כמו זיהוי איזו מבין 1,000 חיות מוצגת בתמונה) — אותו עיקרון בדיוק, רק עם יותר אפשרויות-פלט.

דוגמה מוחשית לרף-דיוק שסיווג-AI הגיע אליו: מחקר משנת 2017 מסטנפורד אימן רשת קונבולוציה (CNN — Convolutional Neural Network) לסווג תמונות של נגעי-עור לפי סיכון-סרטני, והראה שהדיוק שלו תואם לזה של רופאי-עור מומחים — אחת הפעמים הראשונות שנחקר במפורש ובאופן ישיר שביצועי-סיווג-AI מגיעים לרמת-מומחה אנושי במשימה רפואית אמיתית, לא רק בבנצ'מארק מלאכותי.

הערכת-איכות של מסווג לא נעצרת ב"אחוז-דיוק" גולמי, שיכול להטעות במיוחד כשקטגוריה אחת נדירה בהרבה מהאחרת (למשל, אם רק 1% מהדוא"ל הוא ספאם, מודל שתמיד עונה "לא ספאם" יקבל 99% דיוק בלי לזהות אף ספאם אחד). לכן משתמשים גם במדדים כמו "דיוק חיובי" (Precision, מתוך מה שסווג כחיובי — כמה באמת חיובי) ו"היזכרות" (Recall, מתוך כל המקרים החיוביים האמיתיים — כמה נתפסו), שיחד נותנים תמונה מלאה יותר מהמדד היחיד.

זיהוי ספאם בדוא"ל, אבחון מחלה מתמונה רפואית, וסינון תגובות-פוגעניות ברשתות חברתיות — כולם, בבסיסם, משימות סיווג: לקבוע לאיזו קטגוריה שייך פריט נתון. גם מודלי-שפה גדולים מבצעים משימת-סיווג בכל צעד-חיזוי בודד שלהם, במובן הטכני — הם בוחרים טוקן אחד מתוך אוצר-מילים סגור וגדול, לא שונה במהותו מבחירה בין 1,000 קטגוריות אפשריות.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו