דלג לתוכן

ImageNet — מאגר של 14 מיליון תמונות, תויג בידי 49,000 עובדים

היסטוריה ואנשי מפתח

הגדרה

ImageNet הוא מערך-נתונים עצום של מיליוני תמונות מתויגות, שיצרה פיי-פיי לי ועמיתיה — התחרות השנתית סביבו הפכה לזירה שבה הוכחה עליונות הלמידה העמוקה ב-2012.

מה זה ImageNet

ImageNet הוא מאגר-נתונים ענק של תמונות מתויגות-בידי-אדם, שיזמה החוקרת פיי-פיי לי כדי לפתור בעיה בסיסית בלמידת-מכונה: אלגוריתם טוב לא יעבוד היטב אם הנתונים שעליהם הוא מתאמן לא משקפים את מורכבות העולם האמיתי. לדבריה, הרעיון היה "לעשות משהו שהוא חסר-תקדים היסטורית לגמרי — למפות את כל עולם-החפצים". הגרסה הראשונה של המאגר פורסמה ב-2009 כפוסטר-מחקר בפינת-מסדרון של מרכז-ועידות במיאמי ביץ' — כמעט בלי הדים; רבים בקהילת-הראייה-הממוחשבת היו סקפטיים כלפי הרעיון עצמו שיותר נתונים, ולא רק אלגוריתם טוב יותר, יניבו תוצאות טובות יותר.

בניית המאגר: מ-WordNet ל-14 מיליון תמונות מתויגות

פיי-פיי לי החלה לפתח את ImageNet ב-2006 באוניברסיטת פרינסטון, בשיתוף עם קריסטיאן פלבאום (Christiane Fellbaum), אחת החוקרות המשפיעות בהמשך-פיתוחו של מאגר-המילים ההיררכי WordNet — נקודת-המוצא הייתה כ-22,000 שמות-העצם ההיררכיים של אותו מאגר. הרעיון הראשון של הצוות היה לשכור סטודנטים לתואר-ראשון תמורת 10 דולר לשעה כדי לאתר ולתייג תמונות ידנית — אך חישוב מהיר גילה שבקצב הזה ייקח 90 שנה להשלים את המשימה. גם ניסיון להיעזר באלגוריתמי-ראייה-ממוחשבת לאיתור תמונות-מועמדות, עם בני-אדם רק לאימות, ננטש: כך היה המאגר מוגבל-מראש רק לסוגי-התמונות שאלגוריתמים של אז כבר ידעו לזהות. הפתרון הגיע כששיחת-מסדרון עם דוקטורנט חשפה בפני לי את שירות ההמון-מקורי Amazon Mechanical Turk. תיוג התמונות בפועל נמשך מיולי 2008 עד אפריל 2010: כ-49,000 עובדים מ-167 מדינות סיננו ותייגו למעלה מ-160 מיליון תמונות-מועמדות, כשכל תמונה קיבלה שלוש תוויות עצמאיות כדי להבטיח דיוק. התוצאה הייתה מאגר של למעלה מ-14 מיליון תמונות מתויגות-בידי-אדם, פרוסות על-פני יותר מ-20,000 קטגוריות (הגרסה המלאה, ImageNet-21K) — ותת-קבוצה של 1,000 קטגוריות ששימשה לתחרות עצמה (ImageNet-1K), עם 1,281,167 תמונות-אימון, 50,000 לאימות ו-100,000 למבחן.

תחרות ILSVRC

התחרות השנתית סביב המאגר, ILSVRC (ImageNet Large Scale Visual Recognition Challenge), יצאה לדרך ב-2010 עם 11 קבוצות משתתפות בלבד, והפכה בתוך שנים ספורות לזירת-ההשוואה המרכזית של תחום הראייה-הממוחשבת — עד כדי כך שכשמארגני-התחרות ניסו לסגור את הפן התחרותי שלה כבר ב-2014, הם נתקלו בהתנגדות מצד גוגל ופייסבוק, ששתיהן רצו להמשיך ולהצביע על מספר-אחד מוסכם כמדד-הישג ציבורי. התחרות עצמה נמשכה בסופו של דבר עד 2017, אחרי ששיעור-הטעות של המודלים המובילים צנח לכ-2 אחוזים בלבד — הישג שסימן שהאתגר "נפתר" במובן התחרותי, גם אם המאגר עצמו המשיך לשמש למחקר גם אחרי סיום התחרות.

2012: הרגע שבו AlexNet הוכיח שלמידה-עמוקה עובדת

ב-30 בספטמבר 2012 רשת-קונבולוציה (CNN) עמוקה בשם AlexNet — שפיתחו אלכס קריז'בסקי, איליה סוצקבר וג'פרי הינטון מאוניברסיטת טורונטו — השיגה שיעור-שגיאת-top-5 של כ-15.3 אחוזים, פער עצום של למעלה מ-10.8 נקודות-אחוז מתחת למתחרה-השני (כ-41% שיפור יחסי). לפי איליה סוצקבר, עוד לפני התחרות היה ברור לצוות ש"אם עושים עבודה ממש טובה על ImageNet, אפשר לפתור את זיהוי-התמונות" — ותוצאת 2012 סיפקה את ההוכחה בפועל: רשת עם 650,000 נוירונים, שהתאפשרה הודות לכוח-העיבוד של מעבדי-גרפיקה (GPU) של Nvidia, ניצחה בפער כה גדול שהוא עצמו הפך לרגע שבו קהילת-המחקר כולה שינתה כיוון. בתחרות השנה שלאחר מכן (2013) כמעט כל המתמודדים כבר השתמשו ברשתות-עמוקות; עד 2014 זה כבר היה סטנדרט מוחלט.

למה זה נחשב לנקודת-מפנה בהיסטוריית ה-AI

החשיבות ההיסטורית של ImageNet חורגת מהישג טכני בודד. עד אז, מרבית מחקר-הראייה-הממוחשבת נאבק מול מחסור-נתונים כרוני — מודלים אומנו על אלפים בודדים של תמונות, לא מספיק כדי לחשוף את הפוטנציאל האמיתי של רשתות עמוקות. ImageNet הוכיח שכמות-נתונים גדולה ומגוונת היא תנאי-הכרחי, לא פחות מהאלגוריתם עצמו — עיקרון שהפך מאז לאבן-יסוד בכל תחומי הלמידה העמוקה, מעבר לראייה-ממוחשבת בלבד — ותשתית שעליה נבנו מאז שירותי-זיהוי-פנים, מכוניות-אוטונומיות ומערכות-הדמיה-רפואית שמסתמכות על אותם עקרונות-יסוד — כולם ירשו את ההנחה הבסיסית שהוכחה לראשונה על ImageNet: יותר נתונים, מתויגים היטב, שווים יותר מכל תחכום-אלגוריתמי בחלל-ריק.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שאלות נפוצות ❓

מי יצרה את ImageNet ומתי?

פיי-פיי לי, יחד עם עמיתים כמו קריסטיאן פלבאום, החלה לפתח את ImageNet ב-2006 באוניברסיטת פרינסטון, בהשראת מאגר-המילים ההיררכי WordNet. הגרסה הראשונה פורסמה ב-2009.

איך תויגו מיליוני התמונות?

באמצעות שירות ההמון-מקורי Amazon Mechanical Turk: כ-49,000 עובדים מ-167 מדינות סיננו ותייגו למעלה מ-160 מיליון תמונות-מועמדות בין 2008 ל-2010, כשכל תמונה קיבלה שלוש תוויות עצמאיות לדיוק. ניסיון קודם לגייס סטודנטים ב-10 דולר לשעה נזנח אחרי שהתברר שייקח 90 שנה להשלים כך את המשימה.

מה קרה בתחרות ILSVRC ב-2012?

רשת-קונבולוציה עמוקה בשם AlexNet ניצחה בפער עצום של 10.8 נקודות-אחוז מהמתחרה-השני (שיעור-שגיאה של כ-15.3% לעומת כ-26%) — הוכחה מעשית ראשונה שלמידה-עמוקה עובדת בקנה-מידה אמיתי, שהובילה את מרבית המתמודדים לאמץ רשתות-עמוקות כבר בשנה שלאחר מכן.

למה ImageNet נחשבת נקודת-מפנה, לא רק מאגר-נתונים גדול?

כי היא הוכיחה עיקרון שהפך לאבן-יסוד בכל הלמידה העמוקה: כמות-נתונים גדולה ומגוונת היא תנאי-הכרחי להצלחת מודל, לא פחות מתחכום האלגוריתם עצמו — עיקרון שעליו נשענים מאז שירותי-זיהוי-פנים, מכוניות-אוטונומיות ומערכות-הדמיה-רפואית.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו