רקע והשכלה
אלכס קריז׳בסקי הוא מדען-מחשב קנדי שלמד באוניברסיטת טורונטו בהנחיית ג׳פרי הינטון, בהתמקדות ברשתות-נוירונים מלאכותיות ולמידה עמוקה — תחום שבתחילת שנות ה-2010 עדיין נחשב שולי יחסית בקהילת ראיית-המחשב האקדמית.
AlexNet ותחרות ImageNet, 2012
ב-2012 פיתח קריז׳בסקי, יחד עם איליה סוצקבר וג׳פרי הינטון, את AlexNet — רשת-קונבולוציה עמוקה שהוגשה תחת השם "SuperVision" לתחרות-זיהוי-התמונות ImageNet (ILSVRC-2012) ב-30 בספטמבר 2012. הרשת ניצחה בפער עצום: שיעור-שגיאה של 15.3% (מדד top-5), יותר מ-10.8 נקודות-אחוז מתחת למקום השני — פער שלא היה מוכר קודם לכן בתחרות הזו. הרשת אומנה על שני מעבדי-גרפיקה (GPU) מדגם Nvidia GTX 580 (3GB זיכרון כל אחד) במשך כחמישה-שישה ימים על 1.2 מיליון תמונות-אימון — כי גודל הרשת לא התאים לזיכרון של מעבד-גרפיקה בודד.
מי בדיוק עשה מה: חלוקת-התפקידים בפרויקט
לפי תיעוד מפורט של הפרויקט, סוצקבר הוא זה ששכנע את קריז׳בסקי לקחת על עצמו את משימת-האימון על ImageNet; קריז׳בסקי עצמו הרחיב את מסגרת-התוכנה שכתב בעצמו (cuda-convnet) לתמיכה במספר מעבדי-גרפיקה במקביל, וביצע את מרבית עבודת-הכיוונון-העדין של פרמטרי-האימון; הינטון שימש חוקר-ראשי (Principal Investigator) של הפרויקט. הינטון עצמו תיאר את החלוקה הזו בציניות בדיעבד: "איליה חשב שכדאי לעשות את זה, אלכס גרם לזה לעבוד, ואני קיבלתי את פרס נובל" — ציטוט שממחיש עד כמה תרומתו ההנדסית הישירה של קריז׳בסקי הייתה שונה, ולא פחות מכרעת, מתרומת שני שותפיו.
אחרי AlexNet
קריז׳בסקי וסוצקבר מכרו את חברת-הסטארט-אפ שהקימו סביב הטכנולוגיה, DNN Research Inc, לגוגל, שם המשיך קריז׳בסקי לעבוד עד ספטמבר 2017. לאחר מכן עבר לחברת Dessa, סטארט-אפ קנדי שעסק בשיטות-למידה-עמוקה מתקדמות. מאז אין תיעוד ציבורי נרחב על פעילותו המקצועית — קריז׳בסקי נחשב לאחת הדמויות המרכזיות בהיסטוריה של הלמידה העמוקה שבחרה בעקביות שלא לשמור על נוכחות ציבורית בולטת.
מורשת נוספת
מלבד AlexNet, קריז׳בסקי חיבר גם את מערכי-הנתונים CIFAR-10 ו-CIFAR-100 — אוספי-תמונות מתויגות שהפכו לכלי-בדיקה סטנדרטיים במחקר ראיית-מחשב עד היום. הפריצה של AlexNet ב-2012 מוזכרת בעקביות כרגע-המפנה שהחזיר את הלמידה העמוקה למרכז המחקר האקדמי והתעשייתי, והשפעתה חרגה מתחום ראיית-המחשב: הגישה שהוכיחה את עצמה שם (רשתות עמוקות שלומדות מאפיינים ישירות מהנתונים, במקום הנדסת-מאפיינים ידנית) הייתה חלק מהרוח שהובילה בהמשך גם למודלי-שפה כמו BERT ו-GPT.