משבר-השחזוריות (Reproducibility Crisis)

עולם המחקר

הגדרה

משבר-השחזוריות הוא הבעיה המתועדת שבה קשה או בלתי אפשרי לשחזר תוצאות שפורסמו במחקר, בשל קוד חסר, היפר-פרמטרים לא-מדווחים ואי-דטרמיניזם באימון.

הגדרה: מהו משבר-השחזוריות, ומה גורם לו

משבר-השחזוריות מתאר בעיה מתועדת ומתמשכת: תוצאות שמתפרסמות במאמרי מחקר בתחום קשה או בלתי אפשרי לחוקרים אחרים לשחזר, כלומר להגיע לאותן תוצאות באמצעות אותו קוד ואותם נתונים. זהו גלגול ממוקד, בתוך עולם הבינה המלאכותית, של תופעה רחבה יותר המוכרת במדעי החברה והרפואה בשם משבר השחזור הכללי. לתופעה בלמידת מכונה כמה מקורות מוכרים וחוזרים: קוד המימוש של השיטה המוצעת לא משוחרר לציבור, כך שאין דרך לבדוק מה בדיוק הורץ בפועל; היפר-פרמטרים חיוניים - כמו קצב למידה, גודל אצווה או מספר האפוקים - אינם מדווחים במלואם בגוף המאמר; פיצולי האימון-אימות-בדיקה (train/validation/test splits) המדויקים אינם נחשפים, כך שלא ברור אילו דוגמאות בדיוק שימשו לאימון ואילו לבחינת המודל; תוצאות נבחרות באופן סלקטיבי מתוך ריצות רבות (ליקוט תוצאות, cherry-picking) במקום דיווח על כלל הריצות שבוצעו; ואי-דטרמיניזם באימון עצמו - הן בשל זרעי אקראיות (random seeds) שונים והן בשל התנהגות לא-דטרמיניסטית של חישובי GPU - שגורם לכך שאפילו הרצה חוזרת של אותו קוד עצמו, על אותם נתונים, עשויה להניב תוצאות שונות במקצת בכל פעם. הבעיה זוהתה כשיטתית וחוזרת בכמה תת-תחומים של הלמידה העמוקה, ותועדה במחקרים אמפיריים שבחנו מאות מאמרים שפורסמו בכנסים המובילים בתחום, מה שהוביל בהדרגה למספר יוזמות מוסדיות וקהילתיות שמטרתן להקטין את הפער.

עדויות אמפיריות: מחקר גונדרסן וקיינסמו (AAAI 2018)

אחד המחקרים המוקדמים והמצוטטים ביותר בנושא הוא של אוד אריק גונדרסן וסיגבירן קיינסמו, State of the Art: Reproducibility in Artificial Intelligence, שהוצג בכנס AAAI בשנת 2018. החוקרים בחנו 400 מאמרי מחקר אמפיריים שפורסמו בכנסי IJCAI ו-AAAI, ומדדו את מידת התיעוד שלהם באמצעות שישה מדדים המכסים שלושה גורמים: הניסוי (Experiment), הנתונים (Data) והשיטה (Method) - כלומר עד כמה כל מאמר מספק את המידע הדרוש כדי שאדם אחר יוכל לשחזר את הניסוי, לשחזר את עיבוד הנתונים, או לשחזר את מימוש השיטה בעצמו. הממצא המרכזי: בכל אחד משלושת הגורמים תועדו בממוצע רק כ-20% עד 30% מהמשתנים הרלוונטיים, ואף לא מאמר אחד מתוך ה-400 תיעד את כל המשתנים הדרושים לשחזור מלא. רק אחד מששת המדדים הראה שיפור מובהק סטטיסטית עם הזמן, ואילו שאר המדדים לא הראו כל שינוי - כלומר שהמצב לא השתפר באופן עקבי גם בשנים המאוחרות שנבדקו.

מקרה בוחן: למידת חיזוק עמוקה

תת-תחום שבו הבעיה בלטה במיוחד הוא למידת חיזוק עמוקה (deep reinforcement learning). במאמר Deep Reinforcement Learning that Matters (AAAI, 2018) הראו פיטר הנדרסון ושותפיו-למחקר כי אי-הדטרמיניזם בסביבות ה-benchmark הסטנדרטיות, בשילוב עם השונות הפנימית הגבוהה של השיטות עצמן, הופכים את הפרשנות של תוצאות מדווחות לקשה מאוד. בניסויים על סביבות Hopper-v1 ו-HalfCheetah-v1 מתוך OpenAI Gym ועל אלגוריתמים כמו DDPG, TRPO, PPO ו-ACKTR, הם הדגימו כי אותו אלגוריתם בדיוק, עם אותם היפר-פרמטרים, עשוי להניב התפלגויות תוצאות שונות באופן מובהק סטטיסטית רק משום שינוי בזרע האקראיות בין ריצה לריצה; וכי השוואה בין מימושי קוד (codebases) שונים של אותו אלגוריתם עצמו - למשל DDPG שמומש הן ב-OpenAI rllab והן ב-OpenAI Baselines - עשויה להראות פערי ביצועים דרמטיים שאינם נובעים כלל מהשיטה עצמה אלא מפרטי המימוש. המאמר קרא להקפדה על דיווח סטטיסטי מלא, כולל בדיקות מובהקות ותיעוד טווחי היפר-פרמטרים, כתנאי הכרחי להשוואה אמינה בין שיטות שונות.

תגובת הקהילה: תוכנית השחזוריות של NeurIPS

בשנת 2019 השיק כנס NeurIPS - אחד הכנסים המובילים בתחום - תוכנית שחזוריות (Reproducibility Program) שכללה שלושה מרכיבים: מדיניות המעודדת הגשת קוד יחד עם המאמר, אתגר שחזור קהילתי, והכללה של רשימת הבדיקה לשחזוריות בלמידת מכונה (Machine Learning Reproducibility Checklist) כחלק מתהליך ההגשה. לפי דוח שפרסמו ז'ואל פינו ושותפיה-למחקר, Improving Reproducibility in Machine Learning Research, כ-40% מהמחברים דיווחו על עצמם שסיפקו קוד כבר בשלב הגשת המאמר, ונתון זה אושר על ידי לפחות בודק אחד עבור 71.5% מההגשות שדיווחו כך; עד למועד ה-camera-ready עלה שיעור המאמרים המתקבלים עם קוד זמין ל-74.4%, לעומת פחות מ-50% בכנס NeurIPS הקודם ב-2018 ולעומת 36% בשלב ההגשה ו-67% עד camera-ready בכנס ICML של אותה שנה. הרשימה עצמה כוללת שאלות הממוקדות בפרטים כמו פיצולי אימון-אימות-בדיקה וטווחי היפר-פרמטרים; בבדיקה ענו 97% מהמחברים שהמאמר כולל תיאור ברור של המסגרת המתמטית והאלגוריתם, 89% אישרו תיאור ברור של אופן ביצוע הניסויים, ואילו 36% ציינו שסרגלי שגיאה (error bars) כלל אינם רלוונטיים לתוצאות שלהם — כלומר כשני-שלישים בלבד ראו בהם רלוונטיים. הרשימה נותרה חובה בכל הגשה לכנס, והתפתחה בשנים שלאחר מכן לרשימת בדיקה מלאה למאמר הכוללת גם סעיפי אתיקת מחקר ואחריות חברתית.

אתגר השחזור הקהילתי (ML Reproducibility Challenge)

מעבר לדרישות הפורמליות של כנסים, התפתחה בקהילת הלמידה העמוקה גם יוזמה התנדבותית: אתגר השחזור של למידת מכונה (ML Reproducibility Challenge, בקיצור MLRC). את האתגר השיקה ז'ואל פינו בכנס ICLR בשנת 2018, כניסוי קהילתי קטן שבו חוקרים מוזמנים לבחור מאמר שפורסם, לנסות לשחזר את תוצאותיו ולפרסם דוח על מה שמצאו. מוסדות אקדמיים, ובהם אוניברסיטת אמסטרדם, שילבו את האתגר כפרויקט סיום בקורסים ייעודיים בלמידת מכונה. דוחות השחזור המוקדמים פורסמו בכתב העת הפתוח ReScience, המוקדש לשחזוריות במדעי המחשוב. בשנת 2023 עבר האתגר לפרסם ב-TMLR (Transactions on Machine Learning Research), ובשנת 2025 קיימו המארגנים לראשונה כנס פרונטלי באוניברסיטת פרינסטון. בשנת 2026 הפך MLRC למסלול רשמי בתוך כנס NeurIPS עצמו - הפעם הראשונה בתולדות האתגר שבה מדע השחזוריות זוכה לבית קבוע בתוך כנס מרכזי בתחום.

תגי הערכת ארטיפקטים של ACM

מעבר לכנסי למידת מכונה, גם ארגון ACM - המארגן כנסים רבים במדעי המחשב - מפעיל מדיניות רשמית של בחינת ותיוג ארטיפקטים (Artifact Review and Badging). במסגרתה מוענקים למאמרים שעברו בדיקה ייעודית תגים גלויים המודפסים על המאמר המתפרסם עצמו, ובהם: ארטיפקטים זמינים (Artifacts Available) - כאשר הקוד והנתונים הועלו למאגר ארכיוני נגיש עם מזהה קבוע כדוגמת DOI; ארטיפקטים שהוערכו ברמת פונקציונליות או ברמת שימוש חוזר (Artifacts Evaluated – Functional / Reusable) - כאשר בודק מטעם ועדת ההערכה הפעיל בפועל את הארטיפקט ומצא אותו מתועד, עקבי ותקין, ובדרגה הגבוהה יותר גם בנוי היטב מספיק כדי שחוקרים אחרים יוכלו לעשות בו שימוש חוזר; תוצאות ששוחזרו (Results Reproduced) - כאשר צוות שאינו המחברים המקוריים הגיע לתוצאות המרכזיות של המאמר תוך שימוש בארטיפקטים שסיפקו המחברים עצמם; ותוצאות שהופקו מחדש (Results Replicated) - כאשר צוות חיצוני הגיע לאותן תוצאות באופן עצמאי לחלוטין, בלי כל הסתמכות על הקוד או הנתונים שסיפקו המחברים. כנסים רבים במדעי המחשב, ובכללם כנסים הקרובים ללמידת מכונה, אימצו מדיניות דומה כדי לתמרץ פרסום קוד איכותי ונגיש לצד כל מאמר.

שאלות נפוצות ❓

מהם הגורמים העיקריים למשבר-השחזוריות?

קוד מימוש שלא משוחרר, היפר-פרמטרים חסרים, פיצולי נתונים לא-חשופים, ליקוט תוצאות סלקטיבי ואי-דטרמיניזם הנובע מזרעי אקראיות ומחישובי GPU.

כמה ממאמרי המחקר בבינה מלאכותית ניתנים בפועל לשחזור?

לפי סקר של גונדרסן וקיינסמו מ-2018 שבדק 400 מאמרים מכנסי IJCAI ו-AAAI, בכל אחד משלושת הגורמים שנבדקו תועדו רק כ-20% עד 30% מהמשתנים הרלוונטיים, ואף מאמר אחד לא תיעד את כולם.

מה עשה כנס NeurIPS כדי להתמודד עם הבעיה?

החל מ-2019 הנהיג הכנס תוכנית שחזוריות שכוללת מדיניות הגשת קוד, אתגר שחזור קהילתי ורשימת בדיקה חובה, ולפי דוח Pineau et al. שיעור המאמרים המתקבלים עם קוד זמין עלה ל-74.4% עד מועד ה-camera-ready באותה שנה.

מה זה אתגר השחזור של למידת מכונה (MLRC)?

יוזמה קהילתית שהשיקה ז'ואל פינו בכנס ICLR ב-2018, שבה חוקרים מתנדבים מנסים לשחזר מאמרים שפורסמו ומפרסמים דוחות על כך; ב-2026 הפך המיזם למסלול רשמי בתוך כנס NeurIPS.

מהם תגי הארטיפקטים של ACM ומה כל אחד מהם מאשר?

מערכת תיוג גלויה שמוענקת למאמרים שעברו בדיקה, ובהם ארטיפקטים זמינים, ארטיפקטים שהוערכו ברמת פונקציונליות או שימוש חוזר, ותוצאות ששוחזרו או הופקו מחדש על ידי צוות חיצוני.