מטריצת בלבול (Confusion Matrix) היא טבלה שמסכמת את ביצועי מודל-סיווג: כל שורה מייצגת את המחלקה-האמיתית של דוגמאות מסוימות, וכל עמודה מייצגת את המחלקה שהמודל חזה עבורן (או להפך, לפי המוסכמה שבה בוחרים). באלכסון הטבלה נמצאים המקרים שהמודל צדק בהם; מחוץ לאלכסון נמצאות הטעויות, מפורקות לפי הכיוון המדויק שלהן — למשל, בבעיה בינארית (כן/לא) מבחינים בין "חיובי-כוזב" (המודל אמר "כן" בטעות) לבין "שלילי-כוזב" (המודל אמר "לא" בטעות), שתי שגיאות שלעיתים קרובות שונות מאוד בחומרתן המעשית.
מקורו המדויק של המונח אינו חד-משמעי, ומקובל להתייחס אליו כשילוב של כמה שורשים נפרדים: טבלאות דומות להשוואה בין שני סיווגים הופיעו כבר בתחילת המאה ה-20 בסטטיסטיקה וב"טבלאות-מקרים" (Contingency Tables), והשימוש בהן להערכת-דיוק התרחב בפסיכומטריקה ובאבחון-רפואי באמצע המאה. הביטוי "מטריצת בלבול" עצמו התבסס בהדרגה בספרות זיהוי-התבניות בשנות ה-60 וה-70, ומקורות שונים מייחסים לו נקודות-מוצא שונות מעט — לכן, בניגוד לשיטות רבות אחרות באתר הזה, אין כאן תאריך-פרסום או שם-ממציא בודד ומוסכם.
מהמטריצה אפשר לגזור מדדי-ביצועים ממוקדים יותר מ"דיוק" (Accuracy) הכללי הפשוט, שיכול להטעות כשמחלקה אחת נדירה בהרבה מהשנייה. "דיוק-חיובי" (Precision) מודד, מתוך כל התחזיות ה"חיוביות" של המודל, כמה מהן היו נכונות באמת; "היזכרות" (Recall) מודדת, מתוך כל המקרים החיוביים-האמיתיים, כמה מהם המודל תפס בפועל. שני המדדים האלה נמצאים במתח זה עם זה — שיפור אחד לרוב פוגע בשני — ולכן מדד משולב כמו ציון-F1 (F1 Score) משמש לעיתים קרובות לאיזון ביניהם למספר יחיד.
מטריצת בלבול שימושית במיוחד כשעלות-הטעויות אינה סימטרית: במערכת שמזהה מחלה נדירה, למשל, פספוס-מקרה-חיובי (אבחון "בריא" בטעות למי שבאמת חולה) עלול להיות חמור בהרבה מהתראת-שווא (חשד מיותר במי שבריא), ומטריצת-הבלבול מאפשרת לראות בדיוק היכן המודל טועה, לא רק כמה פעמים בסך-הכול. בגלל האסימטריה הזו, שתי מערכות עם אחוז-"דיוק" כללי זהה יכולות בפועל להיות שונות מאוד באיכותן, אם אחת מהן מרוכזת דווקא בטעויות היקרות יותר. כלי-תוכנה ללמידת-מכונה כמעט תמיד כוללים פונקציה מובנית לחישוב מטריצת-בלבול אוטומטית מתוך תוצאות-מודל, מה שהפך אותה לכלי-הערכה סטנדרטי כמעט בכל פרויקט סיווג — מתחרות מדעי-נתונים דוגמת Kaggle ועד מערכות-ייצור בתעשייה, ולעיתים קרובות היא הצעד הראשון שמדען-נתונים בודק אחרי שמודל-סיווג חדש מסיים להתאמן.