הצבעה עיוורת בין שתי תשובות
מודל שיחה — צ'אטבוט — נמדד כאן לא מול תשובות נכונות ידועות מראש, אלא מול מודל אחר. Arena, עד ינואר 2026 בשמה LMArena ולפני כן Chatbot Arena, היא במה חינמית שעלתה ב-24 באפריל 2023 מתוך סביבת המחקר של אוניברסיטת ברקלי. את הזירה בנו שם החוקרים Wei-Lin Chiang ו-Anastasios Angelopoulos; Ion Stoica נמנה עם מייסדי החברה שקמה ממנה ב-2025. הגולש מקליד שאלה משלו, מקבל שתי תשובות משני מודלים אנונימיים ובוחר את הטובה מביניהן; זהות המודלים נחשפת רק אחרי ההצבעה.
המנוע: רגרסיית Bradley-Terry, לא Elo
למרות שהציון מכונה בציבור דירוג Elo, הוא מחושב במודל Bradley-Terry משנת 1952: מודל סטטיסטי שמעריך לכל מודל מקדם מספרי אחד, שממנו נגזרת ההסתברות שהוא ינצח כל מודל אחר בהצבעה. במאמר המייסד מ-2024 כותבים החוקרים במפורש שגרסאות קודמות של הממשק דיווחו ציון Elo, ושהמעבר נעשה מפני שמקדמי Bradley-Terry עדיפים לצורך הערכה סטטיסטית. ההבדל אינו סמנטי: המספר על המסך נראה כמו דירוג שחמט, אך הוא אינו מחושב כך.
ההיקף: מ-240 אלף הצבעות ל-82 מיליון
נכון לינואר 2024, תשעה חודשים אחרי ההשקה, הצטברו בזירה יותר מ-240 אלף הצבעות מכ-90 אלף משתמשים ביותר מ-100 שפות, על פני יותר מ-50 מודלים. מאז גדלה הזירה בסדרי-גודל: ב-28 בינואר 2026 היא דיווחה על יותר מ-5 מיליון משתמשים חודשיים ב-150 מדינות, וב-29 ביוני 2026 על יותר מ-10 מיליון מבקרים חודשיים, 700 מיליון שיחות ו-82 מיליון הצבעות אנושיות. ביוני 2024 נוספה זירת תמונות וב-21 בינואר 2026 זירת וידאו. באפריל 2025 הודיעו מפעילי הזירה על הקמת חברה, ובאותו 28 בינואר 2026 היא שינתה את שמה ל-Arena.
חולשה ראשונה: מצביעים על סגנון
בדיקה שפרסמו מפעילי הזירה עצמם ב-29 באוגוסט 2024 מצאה שהסגנון משפיע חזק על הדירוג. כשמוסיפים לרגרסיה ארבעה משתני-בקרה — אורך התשובה, מספר הכותרות, מספר האלמנטים המודגשים ומספר הרשימות בעיצוב מרקדאון — הטבלה משתנה בפועל: הגרסאות המוקטנות של GPT-4o ושל Grok-2 צנחו מתחת לרוב מודלי-החזית, ואילו Claude 3.5 Sonnet, Opus ו-Llama-3.1-405B טיפסו משמעותית. מאז מתפרסמת טבלה מבוקרת-סגנון לצד הרגילה — ההודאה המפורשת ביותר של הזירה עצמה בכך שההצבעה מודדת גם איך נאמר, לא רק מה נאמר.
חולשה שנייה: לא כל היצרנים מקבלים אותו יחס
מחקר בשם The Leaderboard Illusion, שפורסם באפריל 2025, טען שהזירה מוטה לטובת יצרנים גדולים: הם בודקים גרסאות פרטיות מראש ומפרסמים רק את הטובה מביניהן. החוקרים זיהו 27 גרסאות פרטיות שבדקה Meta לקראת השקת Llama 4. לפי אותו מחקר Google ו-OpenAI קיבלו כ-19.2 וכ-20.4 אחוזים מכלל נתוני הזירה בהתאמה, מול 29.7 אחוזים ל-83 מודלים פתוחי-משקלים יחד — פער שלטענת המחברים מאפשר התאמת-יתר לדפוסי הזירה עצמה.
איך לקרוא ציון של הזירה
הציון הוא תמונת-מצב מתוארכת: מודלים חדשים נכנסים כמעט מדי שבוע והפרשי המקומות הראשונים קטנים. הוא מודד מה גולשים העדיפו בשאלות שהם עצמם ניסחו — לא דיוק עובדתי, לא בטיחות, ולא עלות. לכן הוא משלים מבחני-ידע כמו MMLU ומבחני-קוד כמו HumanEval ואינו מחליף אותם. הזירה עצמה הפכה לנכס מסחרי: ב-6 בינואר 2026 גייסה 150 מיליון דולר לפי שווי של כ-1.7 מיליארד, אחרי סבב-זרע של 100 מיליון לפי שווי 600 מיליון במאי 2025.