משבר-העומס בביקורת-העמיתים בכנסי-AI

עולם המחקר

הגדרה

גל-הגידול בהגשות-המאמרים לכנסי-הבינה-המלאכותית המובילים, שחצה בכמה מהם את סף עשרת-אלפים מאמרים בשנה בלי גידול-מקביל במספר-הבודקים הזמינים — מה שמערער את איכות-ביקורת-העמיתים ומגביר תלות בכלי-AI לכתיבת חוות-דעת.

התופעה: הגשות שחוצות את עשרת-האלפים

מאז ראשית שנות ה-2020, כמות המאמרים המוגשים לכנסי-בינה-מלאכותית מובילים כמו NeurIPS, ICML ו-ICLR תפחה בקצב חד, עד שחצתה בכמה מהם את סף עשרת-אלפים הגשות בשנה בודדת. ב-NeurIPS 2024 הוגשו 15,671 מאמרים, מתוכם התקבלו 4,043 (25.8%); שנה אחר-כך, ב-NeurIPS 2025, המספר טיפס ל-21,575 הגשות, ו-5,290 מהן התקבלו (24.5%). בכנסים אחרים הקפיצה חדה עוד יותר: ב-ICML ההגשות כמעט הוכפלו, מ-12,107 ב-2025 ל-23,918 ב-2026, וב-AAAI-26, לפי עדכון רשמי של מארגני הכנס, הוגשו למסלול הראשי כמעט 29,000 מאמרים — ואחרי סינון הגשות שלא עמדו בכללים נותרו לביקורת כ-23,000, 'כמעט פי-שניים' ממספר המאמרים שנבדקו ב-AAAI-25; וב-ICLR, לפי מאמר-עמדה משנת 2025, ההגשות עלו ב-59.8% בשנה אחת בלבד (2025). קצב-גידול כזה הוא הרקע הישיר למה שאותו מאמר-עמדה מכנה 'משבר ביקורת-העמיתים בכנסי-הבינה-המלאכותית': מספר-הבודקים הזמינים לא גדל באותו קצב, כך שכל בודק נדרש לעבור על יותר מאמרים בפחות זמן.

מאמר-העמדה: מי אחראי, ומי משלם את המחיר

המאמר 'Position: The AI Conference Peer Review Crisis Demands Author Feedback and Reviewer Rewards', מאת ג'אהו קים, יונסאוק לי וסאולקי לי, נבחר להצגה בעל-פה במסלול-מאמרי-העמדה של כנס ICML 2025. טענתו המרכזית: האחריות לירידה באיכות-הביקורת מתחלקת בין שלושה שחקנים — המחברים, שמוגשים לעיתים תחת לחץ-זמן ולעיתים מגישים עבודה לא-בשלה; הבודקים, שנדרשים לחוות-דעת מהירה על נושאים שאינם תמיד בתחום-המומחיות המדויק שלהם; והמערכת עצמה, שאינה מתגמלת ביקורת איכותית ואינה נותנת למחברים משוב מספק כשמאמר נדחה. כראיה לכך, המאמר מצטט סקר-פנימי שערך NeurIPS עצמו ב-2022 בקרב מחברים ובודקים, שחשף שתי הטיות שיטתיות: 'הטיית-תוצאה', שלפיה מחברים נוטים לדרג ביקורת כמועילה יותר כשזו ממליצה על קבלת המאמר, ולא לפי איכותה; ו'הטיית-אורך', שלפיה ביקורת ארוכה מדורגת גבוה יותר מביקורת קצרה גם כשהשתיים מכילות בדיוק אותו תוכן. המאמר מציע לתקן את שני הכשלים האחרונים דרך מנגנון-משוב-למחברים ומערכת-תגמול-לבודקים.

הכנסים מגיבים: הרחבת-סיוע וכלי-AI

כדי להתמודד עם קנה-המידה, כנסים גדולים החלו להיעזר גם בכלי-AI לניהול תהליך-הביקורת עצמו — לא רק להערכת המאמרים המוגשים. מאמר בשם 'AI-Assisted Peer Review at Scale: The AAAI-26 AI Review Pilot' מתעד ניסוי-פיילוט שערך כנס AAAI לקראת מהדורת 2026, שבו קיבל כל מאמר במסלול הראשי — 22,977 מאמרים — חוות-דעת-AI אחת, מסומנת בבירור ככזו, לצד חוות-הדעת האנושיות ולא כתחליף להן; לפי מאמר-הפיילוט, שיושבי-ראש התוכנית של הכנס נמנים עם מחבריו, היקף ההגשות חייב גיוס-והפעלה של יותר מ-28,000 חברי-ועדת-תוכנית, ועדת-תוכנית-בכירה ויושבי-ראש-אזור — כמעט פי-שלושה מגודל-הוועדה ב-AAAI-25. סקר בקרב מחברים וחברי-ועדת-תוכנית שהשתתפו בפיילוט מצא שהם לא רק דיווחו שחוות-הדעת של ה-AI שימושיות, אלא אף העדיפו אותן על-פני חוות-דעת אנושיות במימדים מסוימים, כמו דיוק-טכני והצעות-להמשך-המחקר. הצעד הזה עצמו שנוי-במחלוקת: הוא מנסה לפתור בעיה אחת (עומס) אך פותח דלת לבעיה חדשה, שבה גם הבודקים עצמם עלולים להישען יתר-על-המידה על AI במקום לקרוא את המאמר.

התוצאה: תלות גוברת בכלי-AI בצד הבודקים

אחת ההשלכות המתועדות של העומס היא עלייה בשימוש בכלי-AI מצד הבודקים עצמם, כדי לעמוד בקצב-הביקורת הנדרש. מחקר מ-2024 (Liang ואחרים, שהוצג בכנס ICML 2024 ומצוטט גם במאמר-דעה מ-2026 ב-Communications of the ACM) העריך שבין 6.5% ל-16.9% מהטקסט שהוגש כחוות-דעת בארבעה כנסי-AI שהתקיימו אחרי השקת ChatGPT — ICLR 2024, NeurIPS 2023, CoRL 2023 ו-EMNLP 2023 — ייתכן שעבר שינוי משמעותי בידי מודל-שפה. תופעה זו יצרה שרשרת-תגובה: כנסים כמו NeurIPS ו-ICML אסרו במפורש על העלאת מאמרים המוגשים לביקורת לצ'אטבוטים חיצוניים, משום שהדבר מפר את סודיות-ההגשה, ובמקביל התחילו להטמיע במאמרים עצמם הוראות-מוסתרות שנועדו לחשוף בודק שכן העלה את המאמר ל-AI חרף האיסור — פרקטיקה שמתוארת בהרחבה בערך הנפרד על מלכודות-הזרקת-פקודות נגד ביקורת-עמיתים מבוססת-AI. כך משבר-העומס ומשבר-האמון בשימוש ב-AI לביקורת מתערבבים זה בזה.

למה זה חשוב לקורא שאינו חוקר

לקורא שאינו איש-אקדמיה, המשבר הזה נוגע ישירות לאמון שאפשר לתת לכל 'פריצת-דרך' שמדווחת מכנס-AI. קבלת מאמר לכנס-דגל כמו NeurIPS או ICML מתפרשת כמעט תמיד כתעודת-הכשר מדעית — אך כשמערכת-הביקורת עצמה עמוסה עד-כדי-קריסה, 'התקבל לכנס' הופך למדד פחות ופחות אמין להבחנה בין תגלית מבוססת לטענה שטרם נבדקה כראוי. הבעיה אינה חדשה: כפי שכבר מתועד בערך הנפרד על NeurIPS, ניסוי-עקביות מבוקר שהכנס ערך כבר ב-2014 מצא ששתי ועדות-ביקורת בלתי-תלויות, שבדקו את אותם המאמרים בלי לדעת זו-על-זו, חלקו בכ-26% מהמקרים על עצם ההחלטה לקבל או לדחות מאמר — כלומר חוסר-העקביות מובנה בתהליך גם בלי כל עומס נוסף, וגל-ההגשות הנוכחי רק מחריף בעיה שהייתה קיימת מלכתחילה. הבעיה מחריפה גם תופעה שכבר מתוארת בערך הנפרד על ביקורת-עמיתים מול תרבות-הפרסום-המוקדם: אם ממילא מאמרים רבים מתפרסמים תחילה ב-arXiv בלי ביקורת כלל, ואז גם הביקורת הרשמית שכן מתקיימת סובלת מעומס, שני מסלולי-האימות נחלשים בעת ובעונה אחת.

מגמה נמשכת, לא אירוע חד-פעמי

בניגוד לתקרית מבודדת, מדובר בתופעה נמשכת שספרות-מחקר עצמאית ממשיכה לתעד ולדון בה — מאמרי-עמדה נוספים על אותו נושא ממשיכים להיכתב במסלולי 'Position' של כנסים שונים, סימן לכך שהקהילה המדעית עצמה מכירה בבעיה ומחפשת פתרון מוסדי, לא רק תיקון נקודתי לכנס בודד.

שאלות נפוצות ❓

למה מספר ההגשות לכנסי-AI גדל כל-כך מהר?

הביקוש לפרסם ולהיפגש בכנסים המובילים גדל בעקבות פריצת-הדרך המסחרית של מודלי-שפה גדולים מ-2022 ואילך; ב-NeurIPS, לדוגמה, ההגשות עלו מ-15,671 ב-2024 ל-21,575 ב-2025, וב-ICLR הן עלו ב-59.8% בשנה אחת (2025) — בלי גידול מקביל במספר הבודקים הזמינים.

מי אחראי, לפי מאמר-העמדה, לירידה באיכות-הביקורת?

המאמר מחלק את האחריות בין שלושה גורמים — מחברים שמגישים לעיתים עבודה לא-בשלה, בודקים שנדרשים להעריך יותר מאמרים בפחות זמן, והמערכת עצמה, שאינה מתגמלת ביקורת איכותית ומראה הטיות מתועדות כמו העדפת ביקורת ארוכה על-פני קצרה ללא קשר לתוכן.

איך כנסים מנסים להתמודד עם העומס?

חלקם, כמו AAAI לקראת מהדורת 2026, החלו להיעזר בכלי-AI לצד הבודקים האנושיים — כל אחד מ-22,977 המאמרים קיבל חוות-דעת-AI מסומנת, וסקר בקרב המשתתפים מצא שרבים אף העדיפו אותה על-פני חוות-דעת אנושית במימדים מסוימים.

איך העומס קשור לשימוש-ב-AI מצד הבודקים עצמם?

כדי לעמוד בקצב, חלק מהבודקים החלו להיעזר בכלי-AI לכתיבת חוות-הדעת — מחקר אחד העריך שבין 6.5% ל-16.9% מהטקסט של חוות-הדעת בארבעה כנסי-AI מ-2023–2024 ייתכן שעבר שינוי משמעותי בידי מודל-שפה — פרקטיקה שכנסים כמו NeurIPS ו-ICML אוסרים במפורש, ושהובילה את שני הכנסים, במהדורות 2026 שלהם, להטמיע הוראות-מוסתרות במאמרים כדי לחשוף בודקים המפרים את האיסור.

האם קבלת מאמר לכנס-דגל עדיין ערובה לאיכות מדעית?

פחות מבעבר: כשמערכת-הביקורת עצמה עמוסה, 'התקבל לכנס' נחלש כמדד-אמון — וכפי שמראה ניסוי-העקביות של NeurIPS מ-2014, חוסר-העקביות בין בודקים אינו חדש כלל, אלא מובנה בתהליך.