מה זה MFU, בלי הבלבול הטכני
ניצול משאבי-GPU, הנמדד לרוב כ-MFU (Model FLOPs Utilization), הוא היחס בין כמות-החישוב שהמודל בפועל זקוק-לה לביצוע משימת-אימון או הסקה, לבין שיא-היכולת התיאורטי של חומרת-ה-GPU שמריצה אותו — יחס בין קצב-העיבוד הנצפה לקצב-המרבי שאפשרי ברמת-החומרה. חומרת-GPU כמעט לעולם אינה מנוצלת ב-100%, בגלל זמן שמתבזבז על העברת-נתונים, תזמון-משימות ופעולות-תמיכה שאינן חישוב-מודל טהור — ולכן MFU הוא מדד ליעילות-בפועל, לא רק למהירות.
המקור: מאמר PaLM, 2022
המונח MFU הוצג לראשונה במאמר PaLM (Chowdhery ואחרים, גוגל, 2022), והפך מאז למדד-התייחסות סטנדרטי בענף להערכת-יעילות של כל עומס-אימון או הגשה בקנה-מידה גדול. במאמר עצמו דיווחו החוקרים שמודל PaLM-540B השיג 57.8% ניצול-בפועל-של-החומרה (Hardware FLOPs Utilization, HFU) — אך רק 46.2% MFU, שני מדדים שונים שקל להתבלבל ביניהם.
ההבדל בין MFU ל-HFU
MFU סופר רק את כמות-החישוב האנליטית שהמודל עצמו זקוק-לה כדי לבצע את המשימה. HFU סופר כל חישוב שהחומרה בפועל ביצעה, כולל חישוב-חוזר-של-הפעלות (activation rematerialization) — טכניקה שחוסכת זיכרון אבל דורשת לחשב מחדש חלקים שכבר חושבו. המשמעות: HFU תמיד גבוה או שווה ל-MFU של אותה ריצה, כי הוא כולל עבודה נוספת שאינה תורמת ישירות לתוצאה הסופית.
מה נחשב טוב: 40–55%
אימון-מקדים מכוון-היטב של מודל-טרנספורמר צפוף על חומרת H100, בדיוק bf16, מגיע בדרך-כלל ל-40–55% MFU; מודל Llama-3.1, לדוגמה, דיווח על MFU של 38–43% במהלך האימון. מודלים מסוג תערובת-מומחים (MoE) מגיעים לטווח נמוך יותר, כ-25–40%, כי ניתוב-מפוצל של החישוב מפזר עומס ומקטין את התקרה. אף ריצה לא מגיעה ל-100%, גם בתשתית-מיטבית, בגלל צווארי-בקבוק מובנים כמו רוחב-פס-זיכרון ותקשורת בין-שבבים.
למה זה עולה כסף
עסק ששוכר GPU לפי שעה משלם על מלוא זמן-החומרה, לא רק על החלק המנוצל בפועל לחישוב-מודל. MFU נמוך פירושו ששיעור גבוה מהעלות-בפועל מכוסה על פעולות שאינן קידום-ישיר של האימון או ההסקה — המתנה, תקשורת, חישוב-חוזר — ולכן שיפור-היחס הזה מתורגם ישירות לירידה בעלות-לכל-משימה, בלי צורך בחומרה נוספת או זולה יותר.
מה משפיע על היחס בפועל
היחס תלוי בגודל-האצווה, בגודל-המודל, באופן חלוקת-העבודה בין GPU-ים, ובאיכות-קוד-האימון עצמו. מודל גדול מספיק כדי למלא את זיכרון-החומרה, עם אצווה מותאמת ותקשורת-יעילה בין שבבים, מגיע ל-MFU גבוה יותר ממודל קטן שרץ על אותה חומרה עם תקשורת לא-יעילה — גם כשמדובר באותו סוג-GPU בדיוק.