יער אקראי (Random Forest)

יסודות בינה מלאכותית

הגדרה

יער אקראי (Random Forest) הוא אלגוריתם-אנסמבל שמשלב תחזיות של מאות או אלפי עצי-החלטה שונים, ומצביע ביניהם, כדי לקבל תחזית מדויקת ויציבה יותר מכל עץ בודד.

יער אקראי (Random Forest) הוא שיטת-אנסמבל (Ensemble) בלמידת-מכונה, המשלבת יחד את התחזיות של מאות או אלפי עצי-החלטה נפרדים כדי להגיע לתחזית אחת, מדויקת ויציבה יותר מכל עץ בודד. כל עץ ביער מאומן על מדגם-אקראי-מעט-שונה של נתוני-האימון (בשיטה שנקראת Bagging — קיצור של Bootstrap Aggregating), וכן, בכל פיצול בתוך העץ, נבחר באקראי רק תת-קבוצה קטנה של המשתנים להתחשב בה — לא כל המשתנים הזמינים. שילוב שני מקורות-האקראיות האלה מייצר עצים שונים ובלתי-תלויים יחסית זה בזה, שההצבעה המשותפת שלהם מדויקת בהרבה מהצבעה של עצים דומים מדי.

השיטה פותחה והוצגה במאמר מ-2001 מאת הסטטיסטיקאי ליאו בריימן (Leo Breiman), בכתב-העת Machine Learning — מאמר שמרחיב שיטה מוקדמת-יותר שבריימן עצמו פרסם כמה שנים קודם, Bagging, באמצעות הוספת רכיב-אקראיות נוסף בבחירת המשתנים בכל פיצול בעץ. את היישום התוכנתי המקורי של יער אקראי, ואת שם-המסחר הרשמי "Random Forests", פיתח בריימן יחד עם עמיתתו הסטטיסטיקאית אדל קאטלר (Adele Cutler).

יתרון מרכזי של יער אקראי על-פני עץ-החלטה בודד הוא עמידות בפני התאמת-יתר (Overfitting): עץ בודד עלול ללמוד בעל-פה את פרטי-נתוני-האימון, אבל הצבעת-הרוב של אלפי עצים שונים ובלתי-תלויים ממצעת-החוצה טעויות כאלה. מחיר היתרון הזה הוא פרשנות: קל להסביר החלטה של עץ-החלטה בודד, שלב-אחר-שלב, אך קשה בהרבה להסביר "למה" כשמדובר בהצבעה משותפת של אלפי עצים — יער אקראי נחשב, כמו רשתות-נוירונים, ל"קופסה שחורה" יחסית.

בזכות הדיוק, העמידות בפני רעש, והיכולת לטפל גם בנתונים מספריים וגם בקטגוריאליים בלי הכנה מיוחדת, יער אקראי נפוץ מאוד במגוון רחב של יישומים מעשיים — מציוני-אשראי ואבחון-רפואי ועד גילוי-הונאות. הוא נחשב עדיין לאחת מנקודות-הפתיחה הסטנדרטיות והחזקות ביותר במדעי-הנתונים, לצד שיטת "חיזוק-גרדיאנט" (Gradient Boosting) הקרובה לו ברעיון.