נשירה (Dropout)
הגדרה
Dropout היא טכניקת רגולריזציה שמכבה אקראית חלק מהנוירונים ברשת בזמן כל צעד אימון — מכריחה את המודל ללמוד ייצוגים חסינים יותר, ומפחיתה התאמת-יתר.
בכל צעד אימון, Dropout "מכבה" אחוז מסוים (למשל 20%) מהנוירונים באופן אקראי — הרשת חייבת ללמוד לבצע את המשימה גם בלי להסתמך על אף נוירון בודד באופן קריטי.
השיטה פורסמה ב-2014 על ידי ניתיש סריווסטבה, ג'פרי הינטון ועמיתיהם, בהשראה מפתיעה: הם ציינו שברבייה מינית, ערבוב-גנים אקראי מונע מאורגניזם להסתמך יותר מדי על צירוף-גנים ספציפי אחד — בדיוק כמו ש-Dropout מונע מהרשת להסתמך על נוירון בודד.
מבחינה מתמטית, Dropout שקול בקירוב לאימון-בו-זמנית של אקספוננט עצום של רשתות-משנה שונות במקצת (כל תת-קבוצה אפשרית של נוירונים "דלוקים") ומיצוען יחד — שיטה שנקראית "אנסמבל" (Ensemble) בהקשרים אחרים, אבל בדרך-כלל דורשת אימון כמה מודלים נפרדים ממש; Dropout מקבל יתרון דומה כמעט בחינם, בלי לאמן שום מודל נוסף בפועל.
זה דומה לאימון קבוצה שבה כל פעם חסרים כמה שחקנים אקראיים — הקבוצה חייבת ללמוד לתפקד בכל הרכב, ולא לתלות את הצלחתה בשחקן יחיד. בזמן שימוש בפועל (לא אימון), כל הנוירונים פעילים.
במודלי-שפה-גדולים מודרניים, אחוזי-Dropout נמוכים משמעותית מה-50% הנפוצים ברשתות המקוריות שעליהן הודגמה השיטה — לעיתים 10% ואף פחות, ובחלק מהמודלים הגדולים ביותר Dropout מבוטל כמעט לגמרי. הסיבה: ברשת עם מיליארדי פרמטרים שמאומנת על כמויות-נתונים עצומות, הסיכון להתאמת-יתר קטן משמעותית מאשר ברשתות הקטנות-יחסית של 2014, ולכן פחות דרוש "לרסן" אותה באגרסיביות. גם מיקום ה-Dropout בתוך הרשת השתנה: בטרנספורמרים, לרוב מפעילים אותו רק על שכבות ספציפיות (כמו שכבות ה"קשב" הפנימיות) ולא על הרשת כולה באופן אחיד, כפי שהיה נהוג בעיצוב המקורי של 2014.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות