MNIST

יסודות בינה מלאכותית

הגדרה

MNIST הוא מאגר-ייחוס של תמונות ספרות כתובות-ביד, שהרכיבו יאן לקון, קורינה קורטס וכריסטופר ברג'ס מנתוני NIST לפני קיץ 1994 — הבנצ'מרק הסטנדרטי הראשון והמוכר ביותר לזיהוי-תמונה בלמידת-מכונה.

מה זה MNIST

MNIST (קיצור של Modified NIST) הוא מאגר-נתונים של תמונות ספרות כתובות-ביד, בין 0 ל-9, שהרכיבו יאן לקון, קורינה קורטס וכריסטופר ג'יי-סי ברג'ס לפני קיץ 1994. המאגר כולל 60,000 תמונות-אימון ו-10,000 תמונות-מבחן, כל אחת בגודל אחיד של 28 על 28 פיקסלים בגווני-אפור. הוא הפך עם השנים למאגר-הייחוס הראשון והמוכר ביותר בתחום זיהוי-התמונה — עד כדי כך שנהוג לכנות אותו "Hello World" של למידת-מכונה: הדוגמה הראשונה שכל מי שלומד לבנות רשת-נוירונים מריץ עליה.

המקור: שני מאגרי-NIST שלא הסתדרו יחד

המאגר נבנה מתוך ערבוב-מחדש של שני מאגרים קיימים של המכון האמריקאי לתקנים וטכנולוגיה (NIST): SD-3, שנאסף מעובדי הלשכה-האמריקאית-לסטטיסטיקה-של-אוכלוסין (Census Bureau), ו-SD-7, שנאסף מכ-500 תלמידי-תיכון באזור בת'סדה שבמרילנד. NIST עצמו הגדיר במקור את SD-3 כמערך-האימון הרשמי ואת מאגר-תלמידי-התיכון כמערך-המבחן — אך כתב-היד המסודר של עובדי-משרד היה נקי ונוח-לזיהוי משמעותית מזה של בני-נוער, מה שהיה הופך כל השוואת-ביצועים בין שני המאגרים ללא-הוגנת. הפתרון של לקון, קורטס וברג'ס היה לערבב מחדש את שני המאגרים ולחלק אותם מחדש לקבוצת-אימון של 60,000 תמונות וקבוצת-מבחן של 10,000 תמונות, כך שכל אחת מהן כוללת תערובת דומה של שני סוגי-כתב-היד.

עיבוד מוקדם: מ-128 על 128 בינארי ל-28 על 28 בגווני-אפור

תמונות-המקור המקוריות של NIST היו בינאריות (שחור-לבן בלבד, ללא גווני-ביניים) בגודל 128 על 128 פיקסלים. צוות MNIST נירמל כל תמונה לגודל-אחיד — צמצום ל-20 על 20 פיקסלים תוך שמירה על יחס-הממדים המקורי, ואז מיצוע-קצוות (Anti-aliasing) שהפך אותה לגווני-אפור אמיתיים במקום שחור-לבן חד — ולבסוף מירכוז התמונה בתוך מסגרת סופית של 28 על 28 פיקסלים. הפורמט האחיד והפשוט הזה — קובץ קטן, ללא צבע, ללא רעש-רקע — הוא בדיוק מה שהפך את המאגר לנגיש כל-כך לניסויים: אפשר לטעון את כולו לזיכרון של מחשב רגיל ולהריץ עליו מודל תוך דקות, לא שעות.

תפקיד ב-AI: מבחן-הכניסה הסטנדרטי לכל שיטה חדשה

מאז אמצע שנות ה-90, כמעט כל שיטה חדשה בלמידת-מכונה ובלמידה עמוקה — מרשתות-קונבולוציה ועד שיטות-אנסמבל — נבחנה תחילה על MNIST כדי להוכיח שהיא עובדת בכלל, לפני שהיא מנוסה על בעיות מורכבות יותר. שיעורי-הטעות על המאגר צנחו עם השנים לכ-0.25% בשנים 2016–2018 עבור רשת-קונבולוציה בודדת, ולכ-0.17% עבור אנסמבל של עשרים רשתות מתמחות יחד — רמת-דיוק שכמעט ולא משאירה מרווח-שיפור אמיתי, ומעידה שהמאגר "נפתר" זה-מכבר במובן התחרותי.

פרט נשכח: מבחן-המקור שמעולם לא פורסם במלואו

מחקר מ-2019, "Cold Case: The Lost MNIST Digits", גילה ש"שלבי-העיבוד המדויקים" שהפכו את נתוני-NIST הגולמיים למאגר MNIST "אבדו עם הזמן" — הם לא תועדו באופן מלא כשהמאגר פורסם לראשונה. החוקרים אף גילו שקבוצת-המבחן המקורית שנבנתה כללה בפועל 60,000 דוגמאות, אך רק 10,000 מתוכן חולקו אי-פעם בפומבי — 50,000 הדוגמאות הנותרות נותרו בלתי-מופצות, ואותרו ושוחזרו רק לצורך אותו מחקר. הפער הזה, שהתגלה רק עשרות שנים אחרי הפרסום המקורי, הזיז מעט את שיעורי-השגיאה המדודים, אך הדירוג היחסי בין שיטות שונות שנבדקו על המאגר נשאר, לפי המחקר, אמין באופן כללי — עדות לכך שגם מאגר-בנצ'מרק שמעולם לא תועד באופן מלא יכול להישאר שימושי להשוואה.

מגבלה שהפכה לדוגמה: כשמבחן קל מדי

עצם ההצלחה הזו הפכה את MNIST עם הזמן ליותר תעודת-כניסה חינוכית מאשר אתגר-מחקר אמיתי: מודל יכול להשיג דיוק גבוה-מאוד עליו גם בשיטות פשוטות-יחסית, מה שהופך אותו לפחות שימושי כדי להבדיל בין שיטות-מתקדמות זו מזו. ב-2017 פרסמה Zalando Research מאגר-חלופי, Fashion-MNIST — תמונות של פריטי-אופנה, לא ספרות — המוצג במפורש במאמר-הפרסום שלו כ"תחליף ישיר" (Drop-In Replacement): אותו פורמט בדיוק, 28 על 28 פיקסלים עם 60,000 תמונות-אימון ו-10,000 תמונות-מבחן, אבל אתגר-סיווג קשה משמעותית. בגלל אותה סיבה נדרשו גם מאגרים גדולים ומורכבים הרבה יותר, כמו ImageNet, כדי להמשיך ולדחוף את גבול היכולת של רשת-נוירונים לזהות תמונות — אבל MNIST עצמו נותר, עד היום, נקודת-הפתיחה הסטנדרטית של התחום, לא קו-הסיום שלו.

שאלות נפוצות ❓

מי יצר את MNIST ומתי?

יאן לקון, קורינה קורטס וכריסטופר ברג'ס, שהרכיבו אותו לפני קיץ 1994 מתוך שני מאגרי-נתונים קיימים של NIST.

מאילו מאגרים הורכב MNIST?

מ-SD-3, שנאסף מעובדי הלשכה-האמריקאית-לסטטיסטיקה-של-אוכלוסין, ו-SD-7, שנאסף מכ-500 תלמידי-תיכון בבת'סדה שבמרילנד — שני מאגרים שעורבבו מחדש כדי לאזן בין סוגי-כתב-היד.

כמה תמונות יש במאגר, ובאיזה פורמט?

60,000 תמונות-אימון ו-10,000 תמונות-מבחן, כל אחת בגודל אחיד של 28 על 28 פיקסלים בגווני-אפור.

למה MNIST נחשב פחות שימושי כיום למחקר מתקדם?

כי מודלים מודרניים משיגים עליו דיוק כמעט מושלם (סביב 0.17%–0.25% שיעור-שגיאה) גם בשיטות פשוטות יחסית — מה שהופך אותו למבחן-כניסה חינוכי, לא אתגר-מחקר עדכני.