אמת-מידה (Benchmark)
הגדרה
אמת-מידה (Benchmark) היא מבחן סטנדרטי שמשווה בין מודלי AI שונים על אותה משימה, כדי לדרג ביצועים באופן אובייקטיבי.
💡 דוגמה
כמו מבחן בגרות אחיד לכל המודלים: אותן 164 בעיות תכנות לכולם, וכך אפשר להשוות מי פתר יותר.
אמת-מידה (Benchmark) היא מבחן סטנדרטי ומוגדר מראש שמשווה בין מודלי AI שונים על אותה משימה בדיוק, כדי לדרג ביצועים באופן אובייקטיבי וניתן-להשוואה.
בנצ'מארקים נפוצים בודקים יכולות שונות — הבנת קריאה, פתרון בעיות מתמטיות, כתיבת קוד, ידע כללי. אחד הנפוצים ביותר, MMLU (מבחן-ידע רחב, כ-16,000 שאלות על פני 57 תחומים אקדמיים ומקצועיים), הוצג ב-2020 והפך לציון-השוואה סטנדרטי שכל מודל-דגל חדש מדווח עליו. בנצ'מארקים אחרים בודקים כישורים ספציפיים יותר — HumanEval (164 בעיות תכנות) לכתיבת קוד, ו-GSM8K (כ-8,500 בעיות חשבון) להיגיון מתמטי, ובנצ'מארקים ייעודיים לסוכני-AI (כמו WebArena, כ-812 משימות-אתר אמיתיות) שבודקים לא רק "ידע", אלא ביצוע-פעולות בפועל.
בעיה ידועה: ברגע שבנצ'מארק הופך פופולרי מספיק, קיים סיכון של "אימון-לקראת-המבחן" — מודל שמצטיין בבנצ'מארק ספציפי לא בהכרח מתפקד טוב באותה מידה על משימות דומות שלא נכללו בו במפורש. תופעה זו כבר קרתה בעבר: הבנצ'מארק הוותיק (GLUE — General Language Understanding Evaluation) נחשב "רווי" עד שהחליף אותו SuperGLUE הקשה יותר, ב-2019.
בעיה נוספת: "זיהום-נתונים" (Data Contamination) — כשחלק מנתוני-הבנצ'מארק עצמם מופיעים בטעות בתוך נתוני-האימון של המודל, מה שמנפח ציון בלי לשקף יכולת אמיתית. התופעה קשורה לעיקרון הכללי המכונה "חוק גודהארט": כשמדד הופך למטרה בפני עצמה, הוא מפסיק לשמש מדד אמין ליכולת שהוא נועד למדוד מלכתחילה.
נכון ל-2026, חלק מהבנצ'מארקים הוותיקים כבר נחשבים רוויים גם הם (מודלים מובילים כמעט תמיד מקבלים ציון כמעט-מושלם), מה שדוחף לפיתוח מתמיד של מבחנים קשים וחדשים יותר — כמו FrontierMath ו-Humanity's Last Exam, שנועדו לבחון בעיות שרק מומחים אנושיים מצליחים לפתור. בחלק מהבנצ'מארקים הקשים ביותר (למשל תת-הקבוצה הקשה במיוחד Diamond, מתוך GPQA — Google-Proof Q&A) אפילו רף-הביצוע האנושי-המומחה עומד על כ-70% בלבד, לא 100% — כך שבנצ'מארק טוב, בניגוד לתחרות ספורט, לא תמיד נועד להיפתר במלואו על-ידי אף אחד.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות