מהי הבעיה ש-ResNet פתרה
עד אמצע שנות ה-2010, ככל שחוקרים ניסו להעמיק רשתות-קונבולוציה — להוסיף עוד ועוד שכבות כדי לשפר דיוק — הן דווקא הפכו קשות יותר לאמן, ולעיתים אף פחות מדויקות מרשתות רדודות יותר, לא בגלל התאמת-יתר אלא בגלל קושי אמיתי באופטימיזציה: אות-התיקון שחוזר מ-backpropagation נחלש ("שיפוע-נעלם") ככל שהוא עובר יותר שכבות, עד שהשכבות הראשונות בקושי מתעדכנות. הבעיה הזאת הגבילה בפועל עד כמה אפשר להעמיק רשת ולנצל את מלוא הפוטנציאל של חומרה חזקה יותר ונתונים רבים יותר.
הפתרון: קישורי-שארית (Residual Connections)
קאימינג הה, שיאנגיו ג'אנג, שאוצ'ינג רן וג'יאן סון, מחוקרי Microsoft Research, הציעו ב-2015 פתרון שנשמע כמעט פשוט מדי: לתת למידע לדלג על קבוצות-שכבות שלמות באמצעות "קישורי-שארית" (residual connections) שמחברים ישירות בין שכבה מוקדמת לשכבה מאוחרת יותר. במקום ללמד כל קבוצת-שכבות לחשב את הפלט הרצוי במלואו, היא לומדת רק את ה"שארית" — ההפרש בין הקלט לפלט הרצוי — ומתאמנת קל בהרבה. אם קבוצת-שכבות לא תורמת בפועל, היא יכולה פשוט "לדלג על עצמה" בלי לפגוע בביצועים.
התוצאה: רשתות בנות מאות שכבות
הפתרון הזה איפשר לאמן בהצלחה רשתות עמוקות בהרבה מכל מה שהיה מעשי קודם — עד 152 שכבות במאמר המקורי, יותר מפי שמונה מ-VGG שקדם לו — בלי שהעומק הנוסף יפגע ביכולת-האימון. ה-ResNet שהתקבל, בגרסאות כמו ResNet-50 ו-ResNet-152 (המספר מציין את מספר השכבות), ניצח בתחרות ImageNet לסיווג-תמונות ב-2015 בשיעור-שגיאה נמוך משמעותית מכל מה שקדם לו, וזכה גם בפרסי-זיהוי וסגמנטציה בתחרות COCO של אותה שנה — ניצחון כפול שסימן, לראשונה, שרשתות בעומק כזה בכלל ניתנות לאימון מעשי.
מדוע קישורי-השארית הפכו לתקן כמעט אוניברסלי
מעבר להישג המיידי בתחרות, קישורי-השארית התבררו כרעיון כללי הרבה יותר משיפור-ספציפי לרשתות-קונבולוציה: הם מקלים על אימון כמעט כל רשת-נוירונים עמוקה מספיק, כמעט בלי תלות בסוג המשימה או בתחום. כתוצאה מכך, קישורי-שארית הופיעו מאז כמעט בכל ארכיטקטורה עמוקה משמעותית שפותחה אחרי 2015 — כולל בטרנספורמרים, שהם הבסיס למרבית מודלי-השפה הגדולים של היום, ובמערכות ראייה-ממוחשבת ומשחק כמו AlphaGo Zero. מעטים חידושים בודדים בתחום הלמידה-העמוקה הפכו לנפוצים באותה מהירות ובאותו היקף חוצה-תחומים.
ResNet מול ארכיטקטורות אחרות מאותה תקופה
ResNet לא הופיע בחלל ריק — הוא הגיע כמה שנים אחרי AlexNet (2012), שהראה לראשונה שרשתות-קונבולוציה עמוקות יכולות לנצח בגדול בתחרות ImageNet, ואחרי VGG ו-GoogLeNet (2014), ששניהם ניסו להעמיק רשתות בדרכים אחרות. בעוד VGG הסתמך על ערימה פשוטה של שכבות-פילטר קטנות, ו-GoogLeNet על מבני-הסתעפות מורכבים, ResNet היה הראשון שהציע פתרון ישיר לבעיית-האימון עצמה שהגבילה את שניהם — וזו הסיבה שרעיון קישורי-השארית שרד והתפשט הרבה מעבר לארכיטקטורה הספציפית שהוצגה בו לראשונה.
שימושים היום
ResNet, בגרסאותיו השונות, נותר עד היום אחת מארכיטקטורות-הבסיס (backbones) הנפוצות ביותר ברשתות ראייה-ממוחשבת — משמש כרכיב-ליבה בתוך מערכות זיהוי-עצמים וסגמנטציה רבות, כולל Faster R-CNN ו-Mask R-CNN, וכמודל-ייחוס סטנדרטי שכל ארכיטקטורה חדשה נבחנת מולו. מאמרו המקורי נחשב, באופן עקבי, לאחד המאמרים המצוטטים ביותר במדעי-המחשב של המאה ה-21 — עדות להיקף שבו קישורי-השארית חלחלו לכל תחום הלמידה העמוקה, הרבה מעבר לייעודם המקורי בראייה ממוחשבת בלבד, ולעיתים אף בלי שהמפתחים המשתמשים בהם מודעים כלל למקורם ההיסטורי.