MLCommons ו-MLPerf

עולם המחקר

הגדרה

MLCommons הוא קונסורציום ללא-מטרות-רווח שמפעיל את MLPerf — סדרת אמות-מידה תעשייתיות משותפות, בגיבוי יותר ממאה חברות ומוסדות-אקדמיה, שמודדת ומשווה ביצועי חומרה ותוכנה בלמידת-מכונה באופן אחיד ובר-אימות.

מ-MLPerf ל-MLCommons: איך התחיל הרעיון

רעיון-אמת-המידה עלה לראשונה בפברואר 2018, בפגישה משותפת של מהנדסים וחוקרים מחברת Baidu, מ-Google, ומשלוש אוניברסיטאות — הרווארד, סטנפורד ו-UC ברקלי. בין חברי-הצוות-המייסד נמנו פיטר מטסון (Peter Mattson) מ-Google Brain, דיוויד פטרסון (David Patterson) מ-UC ברקלי, גרג דיאמוס (Greg Diamos) מ-Baidu, קליף יאנג (Cliff Young) מ-Google, פיטר בייליס (Peter Bailis) מסטנפורד וגו-יאן וויי (Gu-Yeon Wei) מהרווארד. תוצאות ה-MLPerf הראשונות בתחום האימון (Training) פורסמו בסוף 2018, ותחום ההסקה (Inference) נוסף ב-2019. בדצמבר 2020 עבר הפרויקט מבנה-ארגוני חדש: MLPerf הפך לחלק ממטריית-על בשם MLCommons — עמותה ללא-מטרות-רווח מסוג 501(c)(6), עם דירקטוריון-מייסד שכלל את Alibaba, Facebook AI, Google, Intel, NVIDIA, ואת פרופ' וויג'יי ג'אנאפה רדי (Vijay Janapa Reddi) מהרווארד, ולצדם יותר מ-50 חברים מייסדים נוספים מהתעשייה והאקדמיה. כיום מונה הארגון, לפי הצהרתו-שלו, למעלה ממאה חברות ומוסדות-אקדמיה כחברים פעילים בקונסורציום.

למה בכלל צריך אמת-מידה משותפת לביצועי-AI

MLCommons בנוי סביב ארבעה תחומי-פעולה מוצהרים: אמות-מידה ומדדים, מערכי-נתונים, שיטות-עבודה מומלצות, ומחקר. המטרה אינה רק "לבדוק כמה מהיר מעבד מסוים", אלא לקבוע שיטת-מדידה אחידה שכל היצרנים — מ-NVIDIA ו-Intel ועד ספקי-ענן חדשים יותר — מריצים באותם תנאים בדיוק, כדי שתוצאה שמפרסמת חברה אחת תהיה ניתנת-להשוואה ישירה מול תוצאה שמפרסמת חברה מתחרה. גוף-על משותף כזה נועד למנוע מצב שבו כל יצרן בוחר לעצמו את תנאי-הבדיקה הנוחים ביותר להצגת המספרים המרשימים ביותר — בלי אפשרות-אימות חיצונית.

איך MLPerf פועל בפועל: אימון מול הסקה

אמות-המידה של MLPerf מתחלקות לשני מסלולים עיקריים. MLPerf Training מודד כמה זמן לוקח לאמן מודל עד לרמת-דיוק נתונה, על עומסי-עבודה אמיתיים כמו אימון-מקדים של מודלי-שפה גדולים. MLPerf Inference מודד, לעומת זאת, כמה מהר וביעילות מערכת יכולה להריץ מודל שכבר אומן — משימה שרלוונטית ישירות לכל שירות-AI מסחרי שרץ בפועל אצל משתמשי-קצה. שני המסלולים מכסים עומסי-עבודה מגוונים — מיצירת-תמונות ומערכות-המלצה ועד אימון מודלי-שפה גדולים — ומאפשרים לגורמים חיצוניים (רוכשי-חומרה, מוסדות-מחקר, ממשלות) להסתמך על מדד אחיד במקום על נתוני-שיווק פנימיים של כל יצרן.

קנה-המידה כיום: עשרות-אלפי תוצאות, שיא-משתתפים

בסבב MLPerf Inference v5.0, שפורסם באפריל 2025, נכללו 17,457 תוצאות-ביצועים מ-23 ארגונים משתתפים — בהם AMD, Google, NVIDIA, Intel, HPE ו-Dell, ולצדם חמישה משתתפים חדשים לגמרי: CoreWeave, FlexAI, GATEOverflow, Lambda ו-MangoBoost. בסבב v5.1 (ספטמבר 2025), נשבר שיא-השתתפות חדש — 27 ארגונים — ולפי דיוויד קנטר (David Kanter), ראש-צוות MLPerf ב-MLCommons, סך התוצאות המצטבר של אמת-המידה חצה אז את רף ה-90,000 תוצאות מאז הקמתה. אותו סבב גם הוסיף שלוש אמות-מידה חדשות — DeepSeek-R1, Llama 3.1 8B ו-Whisper Large V3. תוצאות MLPerf הפכו כלי-שיווק מרכזי גם עבור יצרני-חומרה עצמם: NVIDIA, לדוגמה, מפרסמת דף ייעודי באתרה המציג את תוצאותיה באמות-המידה של MLPerf כהוכחה להובלתה בשוק שבבי-ה-AI — שימוש שממחיש עד כמה אמת-המידה הפכה למטבע-עובר-לסוחר בתעשייה כולה.

מעבר לחומרה: תפקיד רחב יותר בממשל-הידע של AI

MLCommons אינו מוגבל רק למדידת-מהירות של שבבים. תחת אותה מטרייה פועלות גם קבוצות-עבודה למערכי-נתונים משותפים ולשיטות-עבודה מומלצות, שמטרתן לתת לתעשייה ולאקדמיה שפה משותפת לא רק ל"כמה מהר", אלא גם ל"איך נכון לבנות ולתעד" מערכת-למידת-מכונה. הארגון עובד באופן שיתופי-מוצהר: חברות שמתחרות ישירות בשוק (למשל NVIDIA ו-AMD) יושבות יחד באותן קבוצות-עבודה כדי להסכים על שיטת-מדידה אחת שכולן מקבלות כהוגנת. התיאור הרשמי של MLCommons מציג את הפעילות הזו כ"הנדסה קולקטיבית" (Collective Engineering) — עבודה משותפת בין ארגונים שבדרך-כלל מתחרים זה בזה, סביב תשתית שאף אחד מהם לא רוצה לבנות ולתחזק לבד.

התפקיד בממשל-הידע: אמון-משווה, לא רק מספרים

עבור קטגוריית עולם-המחקר, MLCommons עונה על שאלה שונה מזו שעונה עליה זיהום-אמות-מידה (Benchmark Contamination): הבעיה שם היא שנתוני-מבחן דלפו בטעות לתוך נתוני-אימון והציון המדווח מנופח. MLCommons, לעומת זאת, הוא מנגנון-הממשל שמנסה למנוע מלכתחילה מצב שבו אי-אפשר להשוות טענות-ביצועים שונות זו-לזו: הוא לא מתקן דליפת-נתונים בודדת, אלא קובע מראש איך אמור להיראות מבחן-ביצועים הוגן ומשותף שכל התעשייה מסכימה עליו. בלי גוף כזה, כל דיווח-ביצועים של חברה בודדת נשאר טענה בלתי-ניתנת-לאימות חיצוני.

שאלות נפוצות ❓

מה ההבדל בין MLPerf ל-MLCommons?

MLPerf היא סדרת אמות-המידה עצמה, שהחלה כבר ב-2018; MLCommons הוא ארגון-העל ללא-מטרות-הרווח שהוקם בדצמבר 2020 כדי לתפעל את MLPerf ויוזמות נלוות נוספות.

כמה חברות ומוסדות חברים ב-MLCommons?

בהקמתו ב-2020 מנה הארגון יותר מ-50 חברים מייסדים; לפי MLCommons עצמו הוא כולל כיום למעלה ממאה חברות ומוסדות אקדמיים.

מה ההבדל בין MLPerf Training ל-MLPerf Inference?

Training מודד כמה זמן לוקח לאמן מודל עד לרמת-דיוק נתונה; Inference מודד כמה מהר וביעילות מערכת מריצה מודל שכבר אומן — המשימה שרלוונטית לשירותי-AI חיים.

כמה תוצאות נאספו במסגרת MLPerf עד היום?

לפי דיוויד קנטר, ראש-צוות MLPerf, סך התוצאות המצטבר חצה את ה-90,000 בסבב ספטמבר 2025, אז נרשם גם שיא-השתתפות של 27 ארגונים.

האם MLCommons מודד רק ביצועי-חומרה?

לא. לצד אמות-המידה של MLPerf פועלות גם קבוצות-עבודה למערכי-נתונים משותפים ולשיטות-עבודה מומלצות בבינה-מלאכותית, לא רק מדידת-מהירות של שבבים.