ResNet — ארכיטקטורת-רשת עם קישורי-שארית, אפשרה 152 שכבות

יסודות בינה מלאכותית

הגדרה

ResNet היא ארכיטקטורת רשת-קונבולוציה עמוקה, שהציגו קאימינג הה וצוותו ב-Microsoft Research ב-2015, שפתרה בעיה מרכזית שהגבילה עד אז את אימון רשתות עמוקות מאוד.

מהי הבעיה ש-ResNet פתרה

עד אמצע שנות ה-2010, ככל שחוקרים ניסו להעמיק רשתות-קונבולוציה — להוסיף עוד ועוד שכבות כדי לשפר דיוק — הן דווקא הפכו קשות יותר לאמן, ולעיתים אף פחות מדויקות מרשתות רדודות יותר, לא בגלל התאמת-יתר אלא בגלל קושי אמיתי באופטימיזציה: אות-התיקון שחוזר מ-backpropagation נחלש ("שיפוע-נעלם") ככל שהוא עובר יותר שכבות, עד שהשכבות הראשונות בקושי מתעדכנות. הבעיה הזאת הגבילה בפועל עד כמה אפשר להעמיק רשת ולנצל את מלוא הפוטנציאל של חומרה חזקה יותר ונתונים רבים יותר.

הפתרון: קישורי-שארית (Residual Connections)

קאימינג הה, שיאנגיו ג'אנג, שאוצ'ינג רן וג'יאן סון, מחוקרי Microsoft Research, הציעו ב-2015 פתרון שנשמע כמעט פשוט מדי: לתת למידע לדלג על קבוצות-שכבות שלמות באמצעות "קישורי-שארית" (residual connections) שמחברים ישירות בין שכבה מוקדמת לשכבה מאוחרת יותר. במקום ללמד כל קבוצת-שכבות לחשב את הפלט הרצוי במלואו, היא לומדת רק את ה"שארית" — ההפרש בין הקלט לפלט הרצוי — ומתאמנת קל בהרבה. אם קבוצת-שכבות לא תורמת בפועל, היא יכולה פשוט "לדלג על עצמה" בלי לפגוע בביצועים.

התוצאה: רשתות בנות מאות שכבות

הפתרון הזה איפשר לאמן בהצלחה רשתות עמוקות בהרבה מכל מה שהיה מעשי קודם — עד 152 שכבות במאמר המקורי, יותר מפי שמונה מ-VGG שקדם לו — בלי שהעומק הנוסף יפגע ביכולת-האימון. ה-ResNet שהתקבל, בגרסאות כמו ResNet-50 ו-ResNet-152 (המספר מציין את מספר השכבות), ניצח בתחרות ImageNet לסיווג-תמונות ב-2015 בשיעור-שגיאה נמוך משמעותית מכל מה שקדם לו, וזכה גם בפרסי-זיהוי וסגמנטציה בתחרות COCO של אותה שנה — ניצחון כפול שסימן, לראשונה, שרשתות בעומק כזה בכלל ניתנות לאימון מעשי.

מדוע קישורי-השארית הפכו לתקן כמעט אוניברסלי

מעבר להישג המיידי בתחרות, קישורי-השארית התבררו כרעיון כללי הרבה יותר משיפור-ספציפי לרשתות-קונבולוציה: הם מקלים על אימון כמעט כל רשת-נוירונים עמוקה מספיק, כמעט בלי תלות בסוג המשימה או בתחום. כתוצאה מכך, קישורי-שארית הופיעו מאז כמעט בכל ארכיטקטורה עמוקה משמעותית שפותחה אחרי 2015 — כולל בטרנספורמרים, שהם הבסיס למרבית מודלי-השפה הגדולים של היום, ובמערכות ראייה-ממוחשבת ומשחק כמו AlphaGo Zero. מעטים חידושים בודדים בתחום הלמידה-העמוקה הפכו לנפוצים באותה מהירות ובאותו היקף חוצה-תחומים.

ResNet מול ארכיטקטורות אחרות מאותה תקופה

ResNet לא הופיע בחלל ריק — הוא הגיע כמה שנים אחרי AlexNet (2012), שהראה לראשונה שרשתות-קונבולוציה עמוקות יכולות לנצח בגדול בתחרות ImageNet, ואחרי VGG ו-GoogLeNet (2014), ששניהם ניסו להעמיק רשתות בדרכים אחרות. בעוד VGG הסתמך על ערימה פשוטה של שכבות-פילטר קטנות, ו-GoogLeNet על מבני-הסתעפות מורכבים, ResNet היה הראשון שהציע פתרון ישיר לבעיית-האימון עצמה שהגבילה את שניהם — וזו הסיבה שרעיון קישורי-השארית שרד והתפשט הרבה מעבר לארכיטקטורה הספציפית שהוצגה בו לראשונה.

שימושים היום

ResNet, בגרסאותיו השונות, נותר עד היום אחת מארכיטקטורות-הבסיס (backbones) הנפוצות ביותר ברשתות ראייה-ממוחשבת — משמש כרכיב-ליבה בתוך מערכות זיהוי-עצמים וסגמנטציה רבות, כולל Faster R-CNN ו-Mask R-CNN, וכמודל-ייחוס סטנדרטי שכל ארכיטקטורה חדשה נבחנת מולו. מאמרו המקורי נחשב, באופן עקבי, לאחד המאמרים המצוטטים ביותר במדעי-המחשב של המאה ה-21 — עדות להיקף שבו קישורי-השארית חלחלו לכל תחום הלמידה העמוקה, הרבה מעבר לייעודם המקורי בראייה ממוחשבת בלבד, ולעיתים אף בלי שהמפתחים המשתמשים בהם מודעים כלל למקורם ההיסטורי.

שאלות נפוצות ❓

מה הבעיה ש-ResNet פתר?

עד 2015, ככל שהעמיקו רשתות-קונבולוציה, האימון נעשה קשה יותר בגלל "שיפוע-נעלם" — היחלשות אות-התיקון ככל שהוא עובר יותר שכבות. הבעיה הזאת הגבילה בפועל את העומק המעשי של רשתות-נוירונים.

מי פיתח את ResNet ואיפה?

קאימינג הה, שיאנגיו ג'אנג, שאוצ'ינג רן וג'יאן סון, מחוקרי Microsoft Research, פרסמו את הארכיטקטורה ב-2015 במאמר "Deep Residual Learning for Image Recognition".

מהם קישורי-שארית?

חיבורים שמאפשרים למידע לדלג ישירות על קבוצות-שכבות שלמות ברשת, כך שכל קבוצה לומדת רק את ההפרש ("השארית") בין הקלט לפלט הרצוי, במקום את הפלט המלא — מה שהופך אימון של רשתות עמוקות מאוד למעשי.

למה ResNet כל-כך משפיע גם היום?

קישורי-השארית שהציג הפכו לרכיב-בסיס כמעט אוניברסלי בארכיטקטורות עמוקות מודרניות, כולל בטרנספורמרים ובמערכות ראייה-ממוחשבת רבות — הרבה מעבר לתחרות שבה ResNet ניצח לראשונה.