LMArena — זירת דירוג שבה גולשים מצביעים בין שתי תשובות אנונימיות

נתוני AI

הגדרה

LMArena היא זירה שבה גולשים מצביעים בין שתי תשובות אנונימיות, והדירוג נגזר ברגרסיית Bradley-Terry; מ-240 אלף הצבעות בינואר 2024 היא צמחה ליותר מ-82 מיליון ביוני 2026.

הצבעה עיוורת בין שתי תשובות

מודל שיחה — צ'אטבוט — נמדד כאן לא מול תשובות נכונות ידועות מראש, אלא מול מודל אחר. Arena, עד ינואר 2026 בשמה LMArena ולפני כן Chatbot Arena, היא במה חינמית שעלתה ב-24 באפריל 2023 מתוך סביבת המחקר של אוניברסיטת ברקלי. את הזירה בנו שם החוקרים Wei-Lin Chiang ו-Anastasios Angelopoulos; Ion Stoica נמנה עם מייסדי החברה שקמה ממנה ב-2025. הגולש מקליד שאלה משלו, מקבל שתי תשובות משני מודלים אנונימיים ובוחר את הטובה מביניהן; זהות המודלים נחשפת רק אחרי ההצבעה.

המנוע: רגרסיית Bradley-Terry, לא Elo

למרות שהציון מכונה בציבור דירוג Elo, הוא מחושב במודל Bradley-Terry משנת 1952: מודל סטטיסטי שמעריך לכל מודל מקדם מספרי אחד, שממנו נגזרת ההסתברות שהוא ינצח כל מודל אחר בהצבעה. במאמר המייסד מ-2024 כותבים החוקרים במפורש שגרסאות קודמות של הממשק דיווחו ציון Elo, ושהמעבר נעשה מפני שמקדמי Bradley-Terry עדיפים לצורך הערכה סטטיסטית. ההבדל אינו סמנטי: המספר על המסך נראה כמו דירוג שחמט, אך הוא אינו מחושב כך.

ההיקף: מ-240 אלף הצבעות ל-82 מיליון

נכון לינואר 2024, תשעה חודשים אחרי ההשקה, הצטברו בזירה יותר מ-240 אלף הצבעות מכ-90 אלף משתמשים ביותר מ-100 שפות, על פני יותר מ-50 מודלים. מאז גדלה הזירה בסדרי-גודל: ב-28 בינואר 2026 היא דיווחה על יותר מ-5 מיליון משתמשים חודשיים ב-150 מדינות, וב-29 ביוני 2026 על יותר מ-10 מיליון מבקרים חודשיים, 700 מיליון שיחות ו-82 מיליון הצבעות אנושיות. ביוני 2024 נוספה זירת תמונות וב-21 בינואר 2026 זירת וידאו. באפריל 2025 הודיעו מפעילי הזירה על הקמת חברה, ובאותו 28 בינואר 2026 היא שינתה את שמה ל-Arena.

חולשה ראשונה: מצביעים על סגנון

בדיקה שפרסמו מפעילי הזירה עצמם ב-29 באוגוסט 2024 מצאה שהסגנון משפיע חזק על הדירוג. כשמוסיפים לרגרסיה ארבעה משתני-בקרה — אורך התשובה, מספר הכותרות, מספר האלמנטים המודגשים ומספר הרשימות בעיצוב מרקדאון — הטבלה משתנה בפועל: הגרסאות המוקטנות של GPT-4o ושל Grok-2 צנחו מתחת לרוב מודלי-החזית, ואילו Claude 3.5 Sonnet, Opus ו-Llama-3.1-405B טיפסו משמעותית. מאז מתפרסמת טבלה מבוקרת-סגנון לצד הרגילה — ההודאה המפורשת ביותר של הזירה עצמה בכך שההצבעה מודדת גם איך נאמר, לא רק מה נאמר.

חולשה שנייה: לא כל היצרנים מקבלים אותו יחס

מחקר בשם The Leaderboard Illusion, שפורסם באפריל 2025, טען שהזירה מוטה לטובת יצרנים גדולים: הם בודקים גרסאות פרטיות מראש ומפרסמים רק את הטובה מביניהן. החוקרים זיהו 27 גרסאות פרטיות שבדקה Meta לקראת השקת Llama 4. לפי אותו מחקר Google ו-OpenAI קיבלו כ-19.2 וכ-20.4 אחוזים מכלל נתוני הזירה בהתאמה, מול 29.7 אחוזים ל-83 מודלים פתוחי-משקלים יחד — פער שלטענת המחברים מאפשר התאמת-יתר לדפוסי הזירה עצמה.

איך לקרוא ציון של הזירה

הציון הוא תמונת-מצב מתוארכת: מודלים חדשים נכנסים כמעט מדי שבוע והפרשי המקומות הראשונים קטנים. הוא מודד מה גולשים העדיפו בשאלות שהם עצמם ניסחו — לא דיוק עובדתי, לא בטיחות, ולא עלות. לכן הוא משלים מבחני-ידע כמו MMLU ומבחני-קוד כמו HumanEval ואינו מחליף אותם. הזירה עצמה הפכה לנכס מסחרי: ב-6 בינואר 2026 גייסה 150 מיליון דולר לפי שווי של כ-1.7 מיליארד, אחרי סבב-זרע של 100 מיליון לפי שווי 600 מיליון במאי 2025.

שאלות נפוצות ❓

איך נקבע הדירוג ב-LMArena?

גולשים מצביעים בין שתי תשובות אנונימיות לאותה שאלה, וההצבעות מוזנות לרגרסיית Bradley-Terry שמעריכה לכל מודל מקדם אחד. הציון מכונה לעיתים דירוג Elo, אך לפי מאמר המייסד מ-2024 המעבר ל-Bradley-Terry נעשה במפורש מפני שהוא עדיף להערכה סטטיסטית.

כמה הצבעות עומדות מאחורי הדירוג?

יותר מ-240 אלף הצבעות מכ-90 אלף משתמשים ביותר מ-100 שפות, על פני יותר מ-50 מודלים — כך במאמר המייסד, נכון לינואר 2024. מאז גדל ההיקף בסדרי-גודל: ב-29 ביוני 2026 דיווחה הזירה על 82 מיליון הצבעות אנושיות, 700 מיליון שיחות ויותר מ-10 מיליון מבקרים חודשיים.

האם דירוג גבוה בזירה אומר שהמודל טוב יותר?

הוא אומר שגולשים העדיפו את תשובותיו בשאלות שהם עצמם ניסחו. הוא אינו מודד דיוק עובדתי, בטיחות או עלות, והוא מושפע מסגנון: בבדיקה של מפעילי הזירה מאוגוסט 2024, בקרה על אורך התשובה ועל שלושה מאפייני עיצוב מרקדאון הפילה את הגרסה המוקטנת של GPT-4o מתחת לרוב מודלי-החזית והעלתה את Claude 3.5 Sonnet, את Opus ואת Llama-3.1-405B.

מה הביקורת המרכזית על הזירה?

מחקר The Leaderboard Illusion מאפריל 2025 טען שיצרנים גדולים בודקים גרסאות פרטיות ומפרסמים רק את הטובה — 27 גרסאות כאלה זוהו אצל Meta לקראת Llama 4 — ושחלוקת הנתונים אינה שוויונית: כ-20.4 אחוזים ל-OpenAI וכ-19.2 ל-Google, מול 29.7 אחוזים ל-83 מודלים פתוחי-משקלים יחד.

מה קרה לשם LMArena?

הפרויקט עלה כ-Chatbot Arena באפריל 2023, עבר לדומיין lmarena.ai בספטמבר 2024, ובאפריל 2025 הודיעו מפעיליו על הקמת חברה. ב-6 בינואר 2026 הוא גייס 150 מיליון דולר לפי שווי של כ-1.7 מיליארד, וב-28 בינואר 2026 שינה את שמו ל-Arena.