אמת-מידה (Benchmark)
מודלים ושפה
אמת-מידה (Benchmark) היא מבחן סטנדרטי ומוגדר מראש שמשווה בין מודלי AI שונים על אותה משימה בדיוק, כדי לדרג ביצועים באופן אובייקטיבי וניתן-להשוואה.
בנצ'מארקים נפוצים בודקים יכולות שונות — הבנת קריאה, פתרון בעיות מתמטיות, כתיבת קוד, ידע כללי — ומודלים מתחרים מדווחים את הציונים שלהם עליהם כדרך להוכיח יכולת.
בעיה ידועה: ברגע שבנצ'מארק הופך פופולרי מספיק, קיים סיכון של "אימון-לקראת-המבחן" — מודל שמצטיין בבנצ'מארק ספציפי לא בהכרח מתפקד טוב באותה מידה על משימות דומות שלא נכללו בו במפורש.