דלג לתוכן

התאמת-יתר (Overfitting)

יסודות בינה מלאכותית

🆕 את הערך הזה אפשר לקרוא גם בגרסה לגיל 12 או בגרסה למנהלים.

הגדרה

התאמת-יתר (Overfitting) היא כשמודל "משנן" את נתוני האימון במקום ללמוד מהם עקרונות כלליים, ונכשל על מקרים חדשים.

💡 דוגמה

כמו תלמיד ששינן פתרונות של תרגילים מסוימים במקום להבין את השיטה, ונכשל ברגע שהמבחן מנוסח קצת אחרת.

רמת הסבר:

מה זו התאמת-יתר, ולמה היא קורית

התאמת-יתר (Overfitting) היא בעיה נפוצה באימון מודלים: המודל "משנן" את נתוני האימון הספציפיים במקום ללמוד מהם עקרונות כלליים — ואז מצליח מצוין על נתונים שכבר ראה, אבל נכשל על מקרים חדשים שלא נתקל בהם.

הבעיה חמורה יותר ככל שהמודל "גדול" יותר (יש לו יותר פרמטרים) ביחס לכמות נתוני-האימון — מודל גדול-מדי יכול פשוט לזכור כל דוגמה בנפרד, במקום להכליל. ההפך הגמור נקרא "התאמת-חסר" (Underfitting): מודל פשוט-מדי שאפילו לא מצליח ללכוד את התבנית הבסיסית בנתוני-האימון עצמם, ולכן מבצע גרוע גם עליהם וגם על נתונים חדשים.

פשרת הטיה-שונות (Bias-Variance Tradeoff)

המסגרת התיאורטית שמאחורי שתי הבעיות נקראת "פשרת הטיה-שונות" (Bias-Variance Tradeoff). מודל עם הטיה גבוהה מדי (Underfitting) מפשט יתר-על-המידה ומפספס תבניות אמיתיות; מודל עם שונות גבוהה מדי (Overfitting) רגיש-יתר-על-המידה לרעש האקראי הספציפי בנתוני-האימון שלו.

המטרה המעשית היא איזון, לא הקצנה לאף אחד מהכיוונים — מודל שמכליל טוב דורש גם מספיק גמישות ללכוד תבניות אמיתיות, וגם מספיק ריסון כדי לא להסתמך על רעש.

ארבע טכניקות למניעה

כדי למנוע התאמת-יתר, מפתחי-מודלים משתמשים בכמה טכניקות משלימות: רגולריזציה (Regularization) — עונש מתמטי על מורכבות-יתר של המודל; Dropout — כיבוי אקראי של חלק מהנוירונים בכל סבב-אימון, שמכריח את המודל לא להסתמך יותר מדי על תבנית בודדת; אימות-הצלבה (Cross-validation) — בדיקה חוזרת על חלוקות-נתונים שונות; ועצירה-מוקדמת של האימון ברגע שהביצועים על נתוני-בדיקה מתחילים להיחלש, למרות שעל נתוני-האימון הם ממשיכים להשתפר.

Dropout תואר לראשונה במאמר משנת 2014 של ניטיש סריבסטבה, ג'פרי הינטון, אלכס קריז'בסקי, איליה סוצקבר ורוסלן סלחוטדינוב, שפורסם בכתב-העת המדעי Journal of Machine Learning Research (JMLR). הרעיון המרכזי: בכל סבב-אימון "מדגמים" בפועל רשת דקה יותר, אקראית, מתוך הרשת המלאה — כאילו מאמנים בו-זמנית מספר עצום של רשתות-משנה שונות, וממצעים ביניהן. החוקרים הדגימו שיפור מדיד בביצועים בזכות השיטה במשימות מתחומים שונים לגמרי — ראייה ממוחשבת, זיהוי-דיבור, סיווג-מסמכים וביולוגיה חישובית.

אנלוגיית התלמיד ששינן

אנלוגיה שימושית: תלמיד שמשנן בעל-פה את כל תשובות מבחני-העבר, בלי להבין את החומר עצמו — יצליח מצוין אם השאלות יחזרו על עצמן, אבל ייכשל בשאלה חדשה שדורשת הבנה אמיתית.

בדיוק מסיבה זו מפתחי-מודלים תמיד בודקים ביצועים על "קבוצת-בדיקה" נפרדת שהמודל מעולם לא ראה באימון — פער גדול בין ביצועי-האימון לביצועי-הבדיקה הוא הסימן הקלאסי לבעיה.

"התאמת-יתר שפירה": התופעה שעדיין לא הוסברה במלואה

מחקר עדכני יחסית מצא תופעה מפתיעה, "התאמת-יתר שפירה" (Benign Overfitting): רשתות-נוירונים ענקיות שיש בהן הרבה יותר פרמטרים מכמות-הדוגמאות, ולמרות זאת מכלילות היטב לנתונים חדשים — בניגוד לציפייה הקלאסית שמודל כזה פשוט ישנן את הנתונים.

התופעה עדיין לא הוסברה תיאורטית במלואה, ומאתגרת חלק מההנחות הקלאסיות שהיו מקובלות בתחום — אחת הסיבות שבגללן פשרת הטיה-שונות המסורתית, כפי שתוארה למעלה, נחשבת כיום תיאור חלקי בלבד של מה שקורה ברשתות-ענק מודרניות.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שאלות נפוצות ❓

מה ההבדל בין התאמת-יתר להתאמת-חסר?

התאמת-יתר היא מודל שמשנן את נתוני-האימון ונכשל על מקרים חדשים. התאמת-חסר היא ההפך — מודל פשוט-מדי שאפילו לא לוכד את התבנית הבסיסית בנתוני-האימון עצמם, ולכן מבצע גרוע גם עליהם וגם על נתונים חדשים.

מה זו רגולריזציה?

עונש מתמטי שמוסיפים לפונקציית-האימון על מורכבות-יתר של המודל, כדי להרתיע אותו מלהסתמך על תבניות אקראיות וספציפיות-מדי לנתוני-האימון.

מה עושה Dropout?

מכבה אקראית חלק מהנוירונים בכל סבב-אימון, כך שהמודל לא יכול להסתמך יותר מדי על תבנית או נוירון בודד. תואר לראשונה במאמר מ-2014 ב-Journal of Machine Learning Research, ושיפר ביצועים במשימות ראייה, דיבור, סיווג-מסמכים וביולוגיה חישובית.

מה זו "התאמת-יתר שפירה" ולמה היא מפתיעה חוקרים?

תופעה שבה רשתות-נוירונים ענקיות, עם הרבה יותר פרמטרים מכמות-הדוגמאות, עדיין מכלילות היטב לנתונים חדשים — בניגוד לציפייה הקלאסית שמודל כזה פשוט ישנן. התופעה עדיין לא הוסברה תיאורטית במלואה.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו