המתח: לפרסם קודם או לבדוק קודם
בעולם המחקר המסורתי מאמר עובר קודם כול תהליך ביקורת עמיתים (peer review) — קריאה ובדיקה שיטתית של חוקרים אחרים בתחום, לעיתים בכמה סבבים — ורק לאחר אישורם הוא רואה אור בכתב עת מדעי או בכנס. בבינה מלאכותית ולמידת מכונה התהליך התהפך בפועל: הנוהג השולט כיום הוא לפרסם קודם כול טיוטת מאמר (preprint) באתר arXiv, ולתת לקהילה לקרוא, לצטט ולבנות על הממצאים באופן מיידי, עוד לפני שכל גוף חיצוני בדק אותם. ביקורת העמיתים בכנס כמו NeurIPS, ICML או ICLR הופכת לשלב משני שמגיע חודשים אחר כך, ולעיתים כלל לא מתקיים — מאמרים רבים שמעולם לא עברו ביקורת עמיתים פורמלית כבר משפיעים עמוקות על כיוון התחום, מצוטטים באלפי מאמרים אחרים ומשמשים בסיס למוצרים מסחריים, וזאת רק על סמך מספרם הסידורי ב-arXiv (arXiv ID), עוד לפני שהתקבלו בכל כנס או כתב עת.
הזרם שאי אפשר לעצור: קצב הפרסום ב-arXiv
קנה המידה של התופעה נמדד במספרים. באוקטובר 2024 נשבר שיא חודשי חדש ב-arXiv, עם 24,226 מאמרים חדשים שהוגשו לאתר באותו חודש בלבד, לאחר שיא קודם של 21,794 הגשות ביולי אותה שנה. מדעי המחשב היו התחום המוביל מבחינת מספר ההגשות, כאשר שלוש הקטגוריות cs.LG (למידת מכונה), cs.CV (ראייה ממוחשבת) ו-cs.CL (עיבוד שפה טבעית) הצטברו יחד ליותר מ-6,000 הגשות חדשות באותו חודש בלבד — נפח שמעולם לא היה קיים בעידן שבו ביקורת עמיתים קדמה לפרסום. לשם השוואה, באוקטובר 2023 הוגשו 20,710 מאמרים, ומאי 2023 היה החודש הראשון שבו arXiv חצה את רף 20,000 ההגשות החודשיות. בהיקף כזה, אין שום מנגנון ביקורת עמיתים שמסוגל לבחון כל מאמר לפני שהוא נחשף לציבור — הפרסום המיידי הוא ברירת המחדל בפועל בתת-התחומים המרכזיים של בינה מלאכותית, וקטגוריות כמו cs.LG הופכות בפני עצמן לערוץ הפצה מרכזי, במקביל לכתבי העת ולכנסים.
מדיניות הכנסים: הכרה רשמית בנוהג
הכנסים המובילים בתחום לא מתעלמים מהמציאות הזו אלא מעגנים אותה במדיניות רשמית. בקול הקורא הרשמי ל-NeurIPS 2025 נכתב במפורש כי "קיומם של preprints לא-אנונימיים (ב-arXiv או במאגרים מקוונים אחרים, אתרים אישיים או רשתות חברתיות) לא יוביל לדחיית המאמר", וכי הבודקים "יונחו שלא לחפש באופן אקטיבי preprints כאלה, אך היתקלות בהם לא תיחשב לניגוד עניינים". עוד נכתב כי מחברים רשאים להגיש ל-NeurIPS עבודה מוסתרת-זהות שכבר זמינה כ-preprint, למשל ב-arXiv, מבלי לצטט אותה. כלומר, כנסים כמו NeurIPS, ICML ו-ICLR — שנשענים על ביקורת עמיתים אנונימית (double-blind) — הכשירו בפועל מצב שבו המאמר כבר נקרא, מצוטט ואף משפיע על התחום עוד לפני שהוא עבר את הליך הביקורת הפורמלי שלהם. מחקר שבדק 5,050 הגשות ל-ICLR בשנים 2019 ו-2020 מצא מתאם חיובי ומובהק סטטיסטית בין שיעור הקבלה של מאמרים לבין פרסום מוקדם שלהם ב-arXiv תחת שמות מחברים בעלי מוניטין גבוה — ממצא שמעלה חשש של ממש לגבי שחיקת העיוורון הכפול (double-blind) שהתהליך אמור להבטיח.
מודל אחר: הזהירות ברפואה ובביולוגיה
התמונה שונה בתחומים כמו רפואה וביולוגיה. גם שם קיימים אתרי preprint מקבילים — bioRxiv ו-medRxiv — אך הנורמה התרבותית סביבם שונה מהותית. באתר השאלות הנפוצות הרשמי של medRxiv נכתב במפורש כי "כתבי יד המוגשים ל-medRxiv אינם מאושרים על ידי ביקורת עמיתים מדעית, אינם נערכים ואינם עוברים סידור לפני פרסומם באינטרנט", וכי כל preprint מלווה בהצהרה בולטת לפיה "התוכן לא אושר בביקורת עמיתים ואין להשתמש בו כדי להנחות ישירות החלטות קליניות". גם ב-bioRxiv מופיעה הבהרה דומה: "קוראים צריכים להיות מודעים לכך שמאמרים ב-bioRxiv טרם הושלמו סופית על ידי המחברים, עשויים להכיל שגיאות, ומדווחים על מידע שטרם התקבל או אושר בכל דרך שהיא על ידי הקהילה המדעית או הרפואית". שני האתרים אף פונים במפורש לעיתונאים ומבקשים מהם להדגיש שהמידע "טרם הוערך על ידי הקהילה הרפואית ועשוי להיות שגוי". בבינה מלאכותית, לעומת זאת, טענת יכולת חדשה — למשל ביצועים פורצי דרך בבנצ'מארק — נוטה להיתפס בתקשורת וברשתות החברתיות כחדשות תקפות כבר מרגע פרסומה ב-arXiv, בלי הסתייגות מקבילה.
כשהפער מתפוצץ: מקרים מתועדים
שלושה מקרים ממחישים את ההשלכות בפועל. בנובמבר 2022 השיקה Meta את המודל Galactica, שנועד לסייע בכתיבה מדעית, יחד עם מאמר והדגמה פומבית. לפי כתבה ב-MIT Technology Review, ההדגמה "שרדה שלושה ימים בלבד" ברשת בעקבות ביקורת נוקבת — המודל הפיק טקסט מדעי שגוי אך נשמע סמכותי, כולל ציטוטים למאמרים שלא קיימים, ומנהל מכון מקס פלנק למערכות אינטליגנטיות, מייקל בלאק, הזהיר כי התוצרים היו "שגויים או מוטים אך נשמעו נכונים וסמכותיים... זה מסוכן". במרץ 2023 פרסמו חוקרי Microsoft ב-arXiv (ב-22 בחודש) את המאמר "Sparks of Artificial General Intelligence", בטענה ש-GPT-4 "יכול להיחשב באופן סביר לגרסה מוקדמת... של מערכת בינה מלאכותית כללית". המאמר זכה לסיקור תקשורתי נרחב, מעולם לא עבר ביקורת עמיתים, וספג ביקורת — בין השאר מהחוקר גארי מרכוס — על כך שהוא בלתי ניתן לאימות מדעי, שכן החוקרים לא קיבלו גישה לנתוני האימון או לארכיטקטורה של GPT-4. מקרה שלישי נוגע לטענה בדבר "יכולות מתפרצות" (emergent abilities) של מודלי שפה, שהופיעה במאמר שהועלה ל-arXiv ביוני 2022 ופורסם ב-TMLR באוגוסט אותה שנה; הטענה התפשטה בהרחבה בשיח המחקרי, עד שמאמר המשך בשם "Are Emergent Abilities of Large Language Models a Mirage?" שהועלה ל-arXiv באפריל 2023 טען שהתופעה היא במידה רבה תוצר לוואי של בחירת מדד המדידה ולא שינוי אמיתי בהתנהגות המודל, ומאמר זה עצמו התקבל בהמשך לכנס NeurIPS 2023, כלומר גם הביקורת המתקנת עברה תחילה דרך אותו נתיב של פרסום מוקדם ב-arXiv.
מה זה אומר על תרבות המחקר
החוקר גארי מרכוס, בתגובתו למאמר Sparks of AGI, טען שביקורת עמיתים מסורתית כללה "סבבים רבים מאוד של משוב, עריכה והגשה מחדש" שיכלו להימשך שנה ומעלה לפני פרסום, ושבמקרה הזה "הקהילה המדעית נעדרת גישה לנתוני האימון — הכול חייב להתקבל באמונה". לדבריו, מאמר כמו זה מתפקד בפועל כ"הודעה לעיתונות" ולא כמחקר מדעי הניתן לאימות. בעוד תומכי הנוהג הקיים טוענים שהוא מאפשר לתחום מהיר-תנועה לתקן את עצמו ולשתף קוד ותוצאות ברות-שחזור באופן מיידי, מבקריו טוענים שהוא מאפשר לטענות בלתי מבוססות דיין להתפשט הרחק לפני שמישהו הספיק לבדוק אותן — כאשר התגובה הביקורתית, אם בכלל, מגיעה רק בדיעבד, בפוסטים, ברשתות חברתיות או במאמרי המשך. תופעות אחיות בעולם המחקר של הבינה המלאכותית — כמו קשיי שחזור תוצאות וזיהום בנצ'מארקים — מתגלות פעמים רבות דווקא משום שמאמרים יצאו לאור ונקראו בהיקף רחב בטרם עברו את הבדיקה הזו. השאלה אם זהו מחיר סביר עבור קצב חדשנות מהיר, או כשל תרבותי שיש לתקן, נותרת שנויה במחלוקת בקרב חוקרי הבינה המלאכותית עצמם.