הקמה והיסטוריה: מארכיון-פיזיקה של פול גינספרג לספרייה גלובלית
arXiv הוקם ב-14 באוגוסט 1991 בידי הפיזיקאי פול גינספרג (Paul Ginsparg), אז חוקר במעבדת לוס-אלמוס הלאומית (Los Alamos National Laboratory) בארצות-הברית. המטרה המקורית הייתה צנועה וממוקדת: ארכיון להפצת טרום-הדפסים (Preprints) בפיזיקה בין חוקרים, כפתרון לבעיה מעשית-לגמרי — עומס העותקים המודפסים ששוגרו בדואר בין מכוני-מחקר החל להציף את תיבות-הדואר של החוקרים. בשנותיו הראשונות פעל האתר בטכנולוגיית-קבצים ישנה (FTP), ורק ב-1993 עבר לרשת האינטרנט הפתוחה שאנחנו מכירים היום. מאז התרחב arXiv הרחק מעבר לפיזיקה: לפי האתר עצמו הוא מארח כיום שמונה תחומים רחבים בסך-הכול — פיזיקה (ובכללה אסטרופיזיקה), מתמטיקה, מדעי-המחשב, ביולוגיה-כמותית, מימון-כמותי, סטטיסטיקה, הנדסת-חשמל ומערכות, וכלכלה. נכון ל-2026 האתר מארח למעלה משלושה מיליון מאמרים, לפי נתוני arXiv עצמו. במשך רוב תולדותיו נוהל האתר בידי ספריית אוניברסיטת קורנל (Cornell University), שקיבלה עליו אחריות ב-2011; במרץ 2026 הודיע arXiv כי הוא נפרד מקורנל והופך לארגון-ללא-מטרות-רווח עצמאי, בניהול דירקטוריון ומנכ"ל, כשמימונו מגיע בעיקר מקרן סיימונס הבינלאומית (Simons Foundation International), ממוסדות-חברים ומתרומות — ללא כל תשלום מצד המחברים המעלים מאמרים.
איך זה עובד בפועל: פרסום-מוקדם, ולא ביקורת-עמיתים
arXiv הוא, במהותו, אתר להפצה-עצמית (Self-archiving): חוקר מעלה בעצמו את קובץ-המאמר, בלי מתווך ובלי תשלום, והוא מופיע באתר תוך זמן קצר. לפני הפרסום עובר כל מאמר שלב-סינון שנקרא מיסוד (Moderation) — ולא ביקורת-עמיתים (Peer Review), וההבדל הזה הוא לב-ליבו של הערך הזה. מנחי-arXiv הם מומחי-תחום מתנדבים, לרוב בעלי תואר-שלישי, שמאושרים על-ידי ועדות-ייעוץ מקצועיות לכל תחום. תפקידם לבדוק אם המאמר עומד ברף-מקצועיות בסיסי (ניסוח, פורמט, ציטוטים תקינים), אם הוא שייך לקטגוריה שבה הוגש, ואם אין בו העתקה או כפילות — אבל לא, ובמפורש, להעריך אם המסקנות המדעיות שבו נכונות. arXiv עצמו מצהיר על כך בבירור: תוכן המאמרים הוא באחריות המגיש הבלעדית, והוא מוצג "כפי-שהוא, ללא כל אחריות". החל מ-2004 נוסף גם מנגנון-הפניה (Endorsement) שמחייב מחבר-ותיק בקטגוריה לערוב עבור מגיש חדש. כלומר: מאמר יכול להתפרסם ב-arXiv תוך שעות מרגע ההגשה — ולהישאר שם ללא כל ביקורת-עמיתים נוספת, לצמיתות, אם מחברו בחר שלא להגיש אותו גם לכתב-עת או לכנס.
הקטגוריות הרלוונטיות לבינה מלאכותית
מבין שמונת התחומים הרחבים האלה, ענף מדעי-המחשב (cs) הוא כיום המשמעותי ביותר עבור מחקר בינה-מלאכותית, ומתחלק לתת-קטגוריות ממוקדות. cs.AI (Artificial Intelligence) מכסה את רוב תחומי הבינה-המלאכותית — למעט ראייה-ממוחשבת, רובוטיקה, למידת-מכונה ועיבוד-שפה-טבעית, שלכל אחד מהם יש קטגוריה נפרדת משלו. cs.LG (Machine Learning) הוא הקטגוריה הרחבה ביותר בפועל: מאמרים על כל היבטי-הלמידה — מפוקחת, לא-מפוקחת, למידת-חיזוק, בעיות-שודד (Bandit Problems) ועוד — לצד עמידות, הסבריות והוגנות של מודלים. cs.CL (Computation and Language) מכסה עיבוד-שפה-טבעית (NLP): כל מה שקשור להבנה וייצור של שפה אנושית, לא שפות-תכנות מלאכותיות. ולבסוף stat.ML, קטגוריה מקבילה בענף הסטטיסטיקה שמכסה מאמרי למידת-מכונה בעלי ביסוס סטטיסטי או תיאורטי מובהק — מודלים גרפיים, הסקה בממדים-גבוהים ותורת-הלמידה. ארבע הקטגוריות האלה יחד הן, הלכה למעשה, כתב-העת הבלתי-רשמי של תחום ה-AI כולו.
למה מחקר AI מתפרסם כאן — לפני, ולעיתים במקום, כתב-עת
קצב ההתקדמות בתחום הבינה-המלאכותית מהיר מכפי שמחזור-ביקורת-העמיתים המסורתי — שיכול לארוך חודשים עד שנה בכתב-עת מדעי — מסוגל לעמוד בו. כתוצאה מכך הפכה הגשה ל-arXiv לצעד הראשון והמיידי של כמעט כל מעבדת-מחקר בתחום: היא מבטיחה קדימות-פרסום (מי הגיע ראשון לתוצאה), חשיפה מיידית לקהילה, ואפשרות-ציטוט עוד לפני שהמאמר נדון בכל ועדת-ביקורת. מאמרים רבים אכן מוגשים מאוחר יותר גם לכנסים כמו NeurIPS או ICML (ראו ערכים נפרדים בקטגוריה הזו) — אבל בפועל, קהילת ה-AI מתייחסת לגרסת ה-arXiv כאל "הרשומה הרשמית" חודשים לפני שכל ביקורת-עמיתים פורמלית מתרחשת, ולעיתים במקומה לגמרי: מאמר שמעולם לא הוגש לשום כנס או כתב-עת יכול לצבור אלפי ציטוטים ולעצב את השיח המקצועי רק על סמך פרסומו ב-arXiv.
המתח: תפוצה מהירה מול טענות לא-מאומתות
המהירות הזו היא בדיוק המנגנון שמאפשר לטענה לא-מבוססת להגיע לכותרות עוד לפני שמישהו בדק אותה: מאמר שמדווח על תוצאה פורצת-דרך יכול להיסקר בתקשורת הטכנולוגית באותו השבוע שבו הועלה, הרבה לפני שעמית כלשהו ניסה לשחזר את הניסוי או לבחון את שיטתו לעומק. זה בדיוק המקום שממנו נובעים שני התהליכים שמתועדים בערכים נפרדים בקטגוריית עולם-המחקר: משבר-השחזוריות (כשמעבדות אחרות לא מצליחות לשחזר תוצאה מדווחת) וזיהום-אמות-מידה (כשנתוני-מבחן דולפים לתוך נתוני-האימון ומנפחים ציון מדווח) — שני הכשלים האלה קשים במיוחד לזיהוי כשהמאמר שמדווח עליהם מעולם לא עבר עין-בוחנת חיצונית. הראיה העדכנית ביותר למתח הזה היא צעד שנקט arXiv עצמו: ב-31 באוקטובר 2025 הודיעו מנחי-הקטגוריה cs כי החל מאותו מועד, מאמרי-סקירה (Review Articles) ומאמרי-עמדה (Position Papers) יתקבלו רק אם מצורף להם אישור שכבר התקבלו בכתב-עת או בכנס עם ביקורת-עמיתים אמיתית — לא ביקורת בסדנה (Workshop) בלבד. הסיבה שנמסרה הייתה כמותית לגמרי: הקטגוריה קיבלה "מאות מאמרי-סקירה בכל חודש", חלק ניכר מהם מנוסחים על-ידי כלי-בינה-מלאכותית ונטולי דיון מהותי בשאלות-מחקר פתוחות, וצוות-המנחים המתנדב פשוט "אין לו הזמן או כוח-האדם" לבדוק כמות כזו. הצעד הזה מדגים בצורה חדה איך הצלחת arXiv — הנגישות והמהירות שהפכו אותו למרכז-הכובד של פרסום-AI — היא בעצמה מקור-הלחץ שמאלץ אותו לצמצם בהדרגה את התוכן שהוא מוכן לארח בלי ביקורת חיצונית כלשהי.
ההכרה וההשפעה: arXiv כתשתית של תחום שלם
ההשפעה של arXiv על הדרך שבה נעשה מדע זכתה גם להכרה רשמית: בינואר 2021 בחר כתב-העת Nature את arXiv כאחד מ"עשרה קודי-מחשוב ששינו את המדע". עבור תחום הבינה-המלאכותית הספציפית, ההשפעה הזו כמעט אינה ניתנת להפרזה: כמעט כל התקדמות משמעותית בתחום — ממאמרי חוקי-קנה-מידה (Scaling Laws) ועד לארכיטקטורות מודלים חדשות — מתפרסמת שם ראשונה, לרוב בו-ביום שבו החברה או המעבדה שמאחוריה מכריזה עליה בפומבי. הפער בין arXiv כארכיון-פיזיקה שנועד למנוע גלישת-דואר עודף ב-1991, לבין arXiv כתשתית-הפרסום המרכזית של אחד התחומים המדעיים הצומחים ביותר בהיסטוריה שלושה עשורים מאוחר יותר, הוא בעצמו תמצית הסיפור של איך התנהלות-מחקר בעידן-הדיגיטלי השתנתה.