דלג לתוכן

אשכול (Clustering)

יסודות בינה מלאכותית

הגדרה

אשכול הוא שיטת למידה-לא-מפוקחת שמקבצת נתונים דומים יחד, בלי שאף אחד אמר למודל מראש מהן הקבוצות ה"נכונות" — המודל מגלה את המבנה בעצמו.

בהינתן נתונים ללא תיוג, אלגוריתם-אשכול מחפש דמיון פנימי ומקבץ פריטים דומים יחד — למשל, לקוחות עם דפוסי-קנייה דומים, או מסמכים בנושא דומה — בלי הגדרה מראש של כמה קבוצות יש או מה מאפיין אותן.

האלגוריתם הנפוץ ביותר, K-means, מיוחס לסטיוארט לויד מ-Bell Labs (מעבדות-מחקר תעשייתיות מובילות), שתיאר אותו כבר ב-1957 (אף שהמאמר עצמו התפרסם רק ב-1982) לצורך שונה לגמרי — עיבוד-אותות דיגיטלי. השם "K-means" עצמו נטבע רק ב-1967 על ידי החוקר ג'יימס מקווין. K-means דורש לקבוע מראש את מספר-הקבוצות המבוקש (ה"K" בשם), מה שלעיתים דורש ניסוי-וטעייה בפני עצמו כדי למצוא מספר-קבוצות שמניב חלוקה הגיונית.

גישות חלופיות מתמודדות עם המגבלה הזו בדרכים שונות: "אשכול-היררכי" (Hierarchical Clustering) בונה עץ-שלם של קבוצות-בתוך-קבוצות ומאפשר לבחור את רמת-הפירוט הרצויה רק בסוף, בלי לקבוע מספר-קבוצות מראש; DBSCAN מזהה קבוצות לפי צפיפות-נקודות ומצליח למצוא צורות-קבוצה לא-כדוריות ש-K-means מתקשה בהן, ואף מזהה "רעש" — נקודות בודדות שלא שייכות לאף קבוצה.

בעולם מודלי-השפה-הגדולים, אשכול מקבל שימוש חדש: קיבוץ הטמעות-וקטוריות (Embeddings) של מסמכים או שאלות-משתמשים דומות יחד, למשל לצורך ארגון תוצאות-חיפוש או לזיהוי נושאים חוזרים בפניות-לקוחות בקנה-מידה גדול. אשכול משמש גם להמלצות-מוצרים, לפילוח-לקוחות בשיווק, ולעיתים כשלב-עזר בתוך תהליכים גדולים יותר — למשל ארגון מערכי-נתונים ענקיים לפני שמשתמשים בהם לאימון.

הערכת-איכות של תוצאת-אשכול היא בעצמה אתגר, בגלל שאין "תשובה נכונה" מוגדרת-מראש להשוות אליה, בניגוד ללמידה מפוקחת. מדדים כמו "מקדם-הצללה" (Silhouette Score) מנסים לכמת מספרית עד כמה כל פריט קרוב לקבוצה שהוקצה אליה לעומת קבוצות אחרות, אבל בסופו של דבר שיפוט אנושי על סבירות-החלוקה נשאר חלק בלתי-נמנע מהתהליך.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו