דלג לתוכן

נשירה (Dropout)

יסודות בינה מלאכותית

הגדרה

Dropout היא טכניקת רגולריזציה שמכבה אקראית חלק מהנוירונים ברשת בזמן כל צעד אימון — מכריחה את המודל ללמוד ייצוגים חסינים יותר, ומפחיתה התאמת-יתר.

בכל צעד אימון, Dropout "מכבה" אחוז מסוים (למשל 20%) מהנוירונים באופן אקראי — הרשת חייבת ללמוד לבצע את המשימה גם בלי להסתמך על אף נוירון בודד באופן קריטי.

השיטה פורסמה ב-2014 על ידי ניתיש סריווסטבה, ג'פרי הינטון ועמיתיהם, בהשראה מפתיעה: הם ציינו שברבייה מינית, ערבוב-גנים אקראי מונע מאורגניזם להסתמך יותר מדי על צירוף-גנים ספציפי אחד — בדיוק כמו ש-Dropout מונע מהרשת להסתמך על נוירון בודד.

מבחינה מתמטית, Dropout שקול בקירוב לאימון-בו-זמנית של אקספוננט עצום של רשתות-משנה שונות במקצת (כל תת-קבוצה אפשרית של נוירונים "דלוקים") ומיצוען יחד — שיטה שנקראית "אנסמבל" (Ensemble) בהקשרים אחרים, אבל בדרך-כלל דורשת אימון כמה מודלים נפרדים ממש; Dropout מקבל יתרון דומה כמעט בחינם, בלי לאמן שום מודל נוסף בפועל.

זה דומה לאימון קבוצה שבה כל פעם חסרים כמה שחקנים אקראיים — הקבוצה חייבת ללמוד לתפקד בכל הרכב, ולא לתלות את הצלחתה בשחקן יחיד. בזמן שימוש בפועל (לא אימון), כל הנוירונים פעילים.

במודלי-שפה-גדולים מודרניים, אחוזי-Dropout נמוכים משמעותית מה-50% הנפוצים ברשתות המקוריות שעליהן הודגמה השיטה — לעיתים 10% ואף פחות, ובחלק מהמודלים הגדולים ביותר Dropout מבוטל כמעט לגמרי. הסיבה: ברשת עם מיליארדי פרמטרים שמאומנת על כמויות-נתונים עצומות, הסיכון להתאמת-יתר קטן משמעותית מאשר ברשתות הקטנות-יחסית של 2014, ולכן פחות דרוש "לרסן" אותה באגרסיביות. גם מיקום ה-Dropout בתוך הרשת השתנה: בטרנספורמרים, לרוב מפעילים אותו רק על שכבות ספציפיות (כמו שכבות ה"קשב" הפנימיות) ולא על הרשת כולה באופן אחיד, כפי שהיה נהוג בעיצוב המקורי של 2014.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו