דלג לתוכן

AlexNet — רשת-נוירונים שאומנה בטורונטו על שני מעבדי-גרפיקה

היסטוריה ואנשי מפתח

הגדרה

AlexNet היה מודל רשת-קונבולוציה שניצח בפער עצום בתחרות ImageNet ב-2012 — הרגע שמסומן כתחילת "מהפכת הלמידה העמוקה" המודרנית, ששינתה את כיוון כל תחום ה-AI.

הרקע: תחרות ImageNet וקבוצת SuperVision

אלכס קריז'בסקי, איליה סוצקבר וג'פרי הינטון פיתחו את AlexNet באוניברסיטת טורונטו, והגישו אותה לתחרות ILSVRC 2012 (ImageNet Large Scale Visual Recognition Challenge) תחת שם-הצוות ⁦SuperVision⁩. עד אז נשלטה תחרות-זיהוי-התמונות השנתית הזו בידי שיטות מבוססות הנדסת-מאפיינים ידנית; הצוות הימר על גישה שונה לגמרי — רשת-קונבולוציה עמוקה שלומדת את המאפיינים ישירות מהנתונים, בלי הנדסה ידנית מראש.

הארכיטקטורה: שמונה שכבות על שני מעבדי-גרפיקה

הארכיטקטורה כללה שמונה שכבות — חמש שכבות-קונבולוציה ושלוש שכבות מחוברות-במלואן — עם כ-60 מיליון פרמטרים ו-650,000 נוירונים בסך-הכול. חידוש טכני מרכזי היה השימוש בפונקציית-ההפעלה ReLU במקום הפונקציות המקובלות עד אז (טאנגנס-היפרבולי או סיגמואיד), שהאיצה משמעותית את תהליך-האימון. בשל מגבלת-זיכרון, הרשת פוצלה בין שני מעבדי-גרפיקה (Nvidia GTX 580, 3 ג'יגה-בייט זיכרון כל אחד) שעבדו במקביל — פתרון-חומרה יצירתי שהיה בעצמו חלק מהחדשנות, ואיפשר בפועל לאמן רשת גדולה בהרבה ממה שנחשב אז מציאותי על חומרה זמינה.

איך מנעו התאמת-יתר: דרופ-אאוט, הרחבת-נתונים ונרמול

כדי למנוע התאמת-יתר של רשת עם 60 מיליון פרמטרים על מערך-אימון של 1.2 מיליון תמונות בלבד, שילב הצוות כמה טכניקות יחד: שכבת-דרופ-אאוט (dropout) בהסתברות 0.5 בשתי השכבות הראשונות מבין השכבות המחוברות-במלואן, שמכבה נוירונים אקראית במהלך האימון; הרחבת-נתונים מלאכותית — חיתוך אקראי של תמונות בגודל 224 על 224 מתוך תמונות 256 על 256 והיפוך אופקי שלהן, לצד הזזת-צבעים לפי ניתוח-רכיבים-ראשיים (PCA) של ערוצי ה-RGB; ונרמול-תגובה-מקומי בין שכבות-קונבולוציה נבחרות. האימון עצמו רץ 90 סבבים (epochs) בגודל-אצווה (batch size) של 128, מומנטום 0.9 ודעיכת-משקלים 0.0005, עם קצב-למידה שהחל ב-0.01 וצומצם פי עשר באופן ידני שלוש פעמים לאורך האימון — תהליך שנמשך כחמישה עד שישה ימים על שני ה-GPU-ים.

30 בספטמבר 2012: התוצאה שהכריעה

ב-30 בספטמבר 2012 השיגה הרשת שיעור-שגיאת-top-5 של 15.3 אחוזים בתחרות — למעלה מ-10.8 נקודות-אחוז נמוך יותר מהמתחרה-השני, פער עצום שהוכיח שהגישה החדשה (רשתות-קונבולוציה עמוקות + חישוב-GPU + נתונים מרובים) עולה בהרבה על שיטות-הראייה-הממוחשבת המסורתיות שקדמו לה. התוצאה המנצחת התקבלה ממיצוע של שבע רשתות AlexNet שאומנו בנפרד — חמישה במבנה הרגיל ועוד שני מודלים שאומנו-מראש גם על קבוצת-העל של ImageNet מסתיו 2011 (כ-15 מיליון תמונות, כ-22,000 קטגוריות) — ולא ממודל בודד. על מערך-הבדיקה של גרסת 2010 של אותה תחרות דיווח המאמר המקורי על שיעור-שגיאת-top-1 של 39.7 אחוזים ו-top-5 של 18.9 אחוזים, נתון שממחיש כמה חד היה השיפור עד לגרסת 2012.

ההכרה: כמעט 200,000 ציטוטים

המאמר שתיאר את AlexNet צוטט מאז למעלה מ-198,000 פעמים לפי Google Scholar — אחד המאמרים המצוטטים ביותר בתולדות מדעי-המחשב — ופורסם מחדש ב-24 במאי 2017 בכתב-העת ⁦Communications of the ACM⁩ (כרך 60, גיליון 6, עמודים 84 עד 90). קוד-המקור המקורי מ-2012 שוחרר תחת רישיון BSD-2 דרך מוזיאון-ההיסטוריה-של-המחשוב שבקליפורניה. יאן לה-קון, ממציא-שותף של רשתות-הקונבולוציה עצמן, כינה את AlexNet "נקודת-מפנה חד-משמעית בתולדות הראייה-הממוחשבת".

המורשת: מהינטון וסוצקבר ועד ל-LLM של היום

ההצלחה הדרמטית הזו שכנעה את קהילת-המחקר כולה לעבור ללמידה עמוקה, ופתחה את הדלת להשקעות-ענק בתחום שהובילו, בעשור שאחר-כך, למודלי השפה הגדולים (LLM) של היום. שניים משלושת יוצרי AlexNet — הינטון וסוצקבר — המשיכו להיות דמויות מרכזיות בתחום עוד שנים רבות לאחר מכן, כשסוצקבר הפך למדען-הראשי של OpenAI — קו-ישיר בין רגע-המפנה של 2012 לבין מרוץ-הפיתוח של מודלי-השפה-הגדולים שבא אחריו.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שאלות נפוצות ❓

מה בדיוק AlexNet השיגה בתחרות ImageNet של 2012?

שיעור-שגיאת-top-5 של 15.3 אחוזים — למעלה מ-10.8 נקודות-אחוז טוב יותר מהמתחרה-השני, בתחרות ILSVRC 2012. פער כזה לא נראה בתחרות הזו לפני כן, והוא זה ששכנע את קהילת-המחקר לעבור ללמידה עמוקה.

למה הרשת פוצלה בין שני מעבדי-גרפיקה?

כי הרשת, עם כ-60 מיליון פרמטרים, לא הייתה נכנסת לזיכרון של מעבד-גרפיקה בודד מדגם Nvidia GTX 580 (3 ג'יגה-בייט). הפיצול בין שני מעבדים היה פתרון-חומרה הכרחי, לא רק שיפור-מהירות.

אילו טכניקות מנעו מהרשת "לשנן" את מערך-האימון?

שילוב של דרופ-אאוט בהסתברות 0.5 בשכבות המחוברות-במלואן, הרחבת-נתונים מלאכותית (חיתוכים, היפוכים אופקיים והזזת-צבעים) ונרמול-תגובה-מקומי בין שכבות-הקונבולוציה — כל אלה יחד, לא טכניקה בודדת.

מי פיתח את AlexNet, ומאיפה השם?

אלכס קריז'בסקי, איליה סוצקבר וג'פרי הינטון מאוניברסיטת טורונטו, שהתמודדו תחת שם-הצוות SuperVision; השם "AlexNet" עצמו מתייחס לתרומתו ההנדסית המרכזית של קריז'בסקי.

האם AlexNet עדיין רלוונטית טכנית היום, או רק היסטורית?

טכנית — לא: מודלים מאוחרים בהרבה עברו אותה זה מכבר. היסטורית — כן: המאמר צוטט למעלה מ-198,000 פעמים, פורסם מחדש ב-2017 ב-Communications of the ACM, והוא מסומן באופן עקבי כנקודת-הפתיחה של עידן הלמידה-העמוקה.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו