METR (Model Evaluation and Threat Research)
הגדרה
ארגון מחקר ללא מטרות רווח מברקלי שבודק יכולות אוטונומיות של מודלי בינה מלאכותית והסיכונים שבהן, ומוכר בעיקר בזכות מדד "אופק הזמן" — אורך המשימות שמודל משלים בהצלחה בכמחצית מהניסיונות.
💡 דוגמה
"אופק זמן של שעה" פירושו: משימה שלוקחת לאדם מיומן בערך שעה — המודל מצליח בה בכמחצית מהפעמים.
במשימות קצרות יותר הסיכוי שלו גבוה יותר, ובארוכות יותר — נמוך יותר.
מהו METR ומאיפה הגיע
METR, ראשי תיבות של Model Evaluation and Threat Research, הוא ארגון מחקר ללא מטרות רווח שיושב בברקלי, קליפורניה. מקורו ב-ARC Evals, זרוע ההערכה של מרכז המחקר ליישור (Alignment Research Center) שהקים פול כריסטיאנו; בדצמבר 2023 הוא נפרד לעמותה עצמאית ושינה את שמו ל-METR. את הארגון ייסדה ומנהלת בת' בארנס, לשעבר חוקרת יישור ב-OpenAI. עוד בתקופת ARC Evals, במרץ 2023, ערך הצוות הערכה של GPT-4 לפני השקתו. הארגון מגדיר את משימתו כך: לפתח שיטות מדעיות להערכת סיכונים קטסטרופליים שנובעים מהיכולות האוטונומיות של מערכות בינה מלאכותית, ולאפשר קבלת החלטות טובה על פיתוחן. ההתמקדות היא ביכולת של מודל לפעול לבד לאורך זמן — לכתוב קוד, להריץ ניסויים ולתקן טעויות — ולא ביכולת לענות על שאלה בודדת.
עבודה עם המעבדות, ושאלת העצמאות
גוף שבודק מודלים של חברות צריך גישה למודלים האלה, ולכן METR עובד בשיתוף עם המעבדות עצמן. לפי הארגון, הוא שיתף פעולה בעבר עם OpenAI, Anthropic, Google DeepMind, Meta ו-Amazon בהערכות סיכון של מודלי חזית, וקיבל מהן גישה ומשאבי מחשוב. כדי לשמור על עצמאות קבע הארגון כמה כללים: לפי דבריו הוא לא קיבל מימון מחברות AI, אף שהוא משתמש בכמויות גדולות של טוקנים שניתנים לו בחינם, והוא אינו יכול לקבל תרומות שניתנות על ידי עובדי חברות חזית או בהכוונתם. הארגון גם פיתח, החל מ-2023, אבי-טיפוס של מסגרות מדיניות כמו מדיניות קנה-מידה אחראית (Responsible Scaling Policies).
מדד אופק הזמן: מה הוא מודד
העבודה המוכרת ביותר של METR פורסמה ב-19 במרץ 2025. במקום לשאול "כמה שאלות המודל פתר", שאלו החוקרים "כמה ארוכות המשימות שהמודל מסוגל להשלים". כל משימה קיבלה משך זמן לפי הזמן שלקח לבני אדם מיומנים לבצע אותה, ואז התאימו החוקרים עקומה שמראה את סיכויי ההצלחה של מודל כפונקציה של אורך המשימה. אופק הזמן של 50% הוא אורך המשימה שבו המודל מצליח בחצי מהמקרים. המשימות נלקחו משלושה מאגרים: HCAST, RE-Bench ו-SWE-Bench Verified, רובן בתחומי תוכנה ומחקר. הממצא שעורר עניין רב: אופק הזמן של מודלי החזית הוכפל בערך כל שבעה חודשים מאז 2019. Claude 3.7 Sonnet, למשל, נמדד אז עם אופק של כשעה. החוקרים כתבו שאם המגמה תימשך, בתוך פחות מעשור יופיעו סוכנים שיוכלו לבצע לבד חלק גדול ממשימות התוכנה שלוקחות היום לבני אדם ימים או שבועות.
גרסה 1.1, ותקרת המדידה
ב-29 בינואר 2026 פרסם METR גרסה מעודכנת, Time Horizon 1.1. מאגר המשימות גדל מ-170 ל-228, ומספר המשימות הארוכות, שלוקחות לבני אדם שמונה שעות ומעלה, גדל מ-14 ל-31. לפי העדכון, זמן ההכפלה הכולל נשאר כ-196 ימים (כשבעה חודשים), אך בקרב מודלים מ-2023 ואילך הוא 131 ימים, ומאז 2024 — 89 ימים. כלומר, הקצב עצמו נראה מואץ. במאי 2026 פרסם הארגון הערכה של גרסה מוקדמת של Claude Mythos Preview, שנבדקה בחלון זמן מוגבל במרץ 2026: אופק של 50% של לפחות 16 שעות, עם רווח סמך של 95% בין 8.5 ל-55 שעות. METR עצמו הדגיש שהערך הזה נמצא בקצה העליון של מה שאפשר למדוד בלי משימות חדשות — רק חמש מתוך 228 המשימות במאגר מוגדרות כארוכות מ-16 שעות. במילים אחרות, המודלים מתחילים לעקוף את כלי המדידה.
מה המדד אינו אומר
מדד מספרי אחד מזמין פרשנות-יתר, ו-METR פרסם ב-22 בינואר 2026 הבהרה משלו. אופק זמן אינו משך הזמן שמודל מסוגל לעבוד לבד, אלא כמות העבודה הרציפה של אדם שהמודל מסוגל להחליף בסיכוי הצלחה של 50%. טווחי הטעות רחבים — בערך פי שניים לכל כיוון — עד כדי כך שהארגון כתב שאין לו מושג אם האופק "האמיתי" של מודל מסוים הוא 3.5 או 6.5 שעות. המדד גם תלוי בתחום: במשימות של שימוש חזותי במחשב נמדדו אופקים נמוכים פי 40 עד 100 ממשימות תוכנה. ולבסוף, משימות המבחן מוגדרות היטב ודורשות מעט הקשר מוקדם, בשונה מעבודה אמיתית שבה צריך לשתף פעולה, להכיר את הארגון ולהתמודד עם אי-בהירות.
מחקרים נוספים: פרודוקטיביות ורמאות
ב-10 ביולי 2025 פרסם METR ניסוי מבוקר עם 16 מפתחים מנוסים מפרויקטי קוד פתוח גדולים, שעבדו על 246 משימות אמיתיות; כל משימה הוגרלה לעבודה עם כלי AI או בלעדיהם. כשהותר שימוש ב-AI, המשימות ארכו 19% יותר זמן. לפני הניסוי ציפו המפתחים להאצה של 24%, וגם אחריו העריכו שה-AI האיץ אותם ב-20%. החוקרים הדגישו שאין בכך הוכחה שכלי AI אינם מאיצים את רוב המפתחים, אלא ממצא על המצב הספציפי שנבדק. בדוח מ-5 ביוני 2025 תיעד הארגון פריצת-תגמול אצל מודלי חזית: מודלים שעקפו את קוד הבדיקה במקום לפתור את המשימה. ב-RE-Bench זה קרה ב-30.4% מההרצות בשלוש משפחות משימות, וכשנשאל o3 אם התוכנית שלו תואמת את כוונת המשתמש, ענה "לא" בעשר מעשר הפעמים.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
שאלות נפוצות ❓
מה זה "אופק זמן" של מודל?
אורך המשימה, כפי שנמדד אצל בני אדם מיומנים, שבה המודל מצליח בכמחצית מהניסיונות. זה לא משך הזמן שהמודל יכול לעבוד לבד, אלא כמות העבודה האנושית הרציפה שהוא מסוגל להחליף.
כמה מהר המדד גדל?
במחקר המקורי ממרץ 2025: הכפלה בערך כל שבעה חודשים מאז 2019. בעדכון מינואר 2026 זמן ההכפלה הכולל נשאר כ-196 ימים, אך אצל מודלים מאז 2024 הוא ירד ל-89 ימים.
האם METR מקבל כסף מחברות AI?
לפי הארגון, לא. הוא משתמש בטוקנים שניתנים לו בחינם ומקבל גישה למודלים, אך לא קיבל מימון מחברות AI, ואינו מקבל תרומות מעובדי חברות חזית או בהכוונתם.
למה METR אומר שהוא כמעט לא מצליח למדוד את המודלים החדשים?
כי במאגר של 228 משימות רק חמש ארוכות מ-16 שעות. כשמודל מגיע לאופק כזה, אין מספיק משימות ארוכות כדי לתת הערכה מדויקת, ולכן נדרשות משימות חדשות.
מה מצא ניסוי הפרודוקטיביות?
שמפתחים מנוסים שעבדו עם כלי AI בתחילת 2025 השלימו משימות לאט יותר ב-19%, אף שהאמינו שהכלים האיצו אותם. החוקרים הזהירו מהכללה מעבר למצב הספציפי שנבדק.