דלג לתוכן

עץ החלטה (Decision Tree)

יסודות בינה מלאכותית

הגדרה

עץ החלטה הוא מודל למידת-מכונה שמקבל החלטות דרך סדרת שאלות כן/לא, בדומה למשחק "עשרים שאלות" — פשוט להבנה ולפירוש בהשוואה לרשתות-נוירונים.

עץ-החלטה מתחיל בשאלה אחת (למשל "הגיל מעל 30?"), ולפי התשובה מפצל לשאלה הבאה, עד שמגיע לתשובה סופית — מבנה שקל לצייר ולהסביר לבן-אדם, בניגוד ל"קופסה השחורה" של רשת-נוירונים.

האלגוריתם הקלאסי לבניית עצים כאלה, ID3, פורסם ב-1986 על ידי רוס קווינלן, ושופר בהמשך לגרסה חזקה יותר, C4.5. השאלה שכל אלגוריתם כזה חייב לפתור בכל פיצול היא איזו שאלה לשאול קודם — האלגוריתמים בוחרים את השאלה שמפרידה הכי טוב בין הקטגוריות, לפי מדד סטטיסטי שנקרא "אי-טוהר ג'יני" (Gini Impurity) או "אנטרופיה" (Entropy, אותו מושג שמופיע גם בפונקציית-האיבוד של מודלי-סיווג).

כיום, בפועל, לרוב לא משתמשים בעץ בודד אלא ב"יער אקראי" (Random Forest) — מאות או אלפי עצים שונים, שכל אחד אומן על מדגם-אקראי-שונה-מעט של הנתונים, מצביעים יחד, ותוצאת-הרוב שלהם מדויקת בהרבה מכל עץ בודד. שיטה קרובה ונפוצה עוד יותר בתעשייה, "חיזוק-גרדיאנט" (Gradient Boosting, ובפרט הספרייה XGBoost), בונה עצים בזה-אחר-זה כשכל עץ חדש מתמקד בתיקון הטעויות של העצים שקדמו לו — טכניקה ששולטת עדיין כיום בתחרויות מדעי-נתונים רבות, גם בעידן הלמידה-העמוקה.

יתרונו המרכזי של עץ בודד הוא פרשנות: אפשר להראות בדיוק למה המודל הגיע להחלטה מסוימת, שלב-אחר-שלב — חשוב בתחומים כמו אישור-הלוואות או אבחון-רפואי, שם דורשים הסבר, לא רק תשובה. יתרון-הפרשנות הזה נחלש כשעוברים ל"יער אקראי" של אלפי עצים — קשה בהרבה להסביר לבן-אדם "למה" כשמדובר בהצבעת-רוב של אלפי החלטות שונות, לא בשרשרת-שאלות בודדת.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו