Gender Shades הוא מחקר פורץ-דרך שפרסמו החוקרות ג'וי בואולמוויני מ-MIT Media Lab וטימניט גברו ב-2018, בכנס Fairness, Accountability, and Transparency (FAT*). המחקר בדק כמה מדויקות מערכות מסחריות מובילות בסיווג-מגדר של אדם מתוך תמונת-פנים. הממצא המרכזי: שיעור-הטעות במקרה-הגרוע-ביותר על נשים כהות-עור הגיע ל-34.7 אחוזים — לעומת 0.8 אחוזים בלבד על גברים בהירי-עור, באותה משימה בדיוק ובאותן מערכות.
כדי לחשוף את הפער הזה, החוקרות בנו מאגר-תמונות מאוזן במיוחד בשם Pilot Parliaments Benchmark, עם ייצוג יחסית-שווה של סוגי-עור שונים ושני המגדרים — בניגוד למאגרי-הבדיקה הנפוצים אז, שהיו מוטים באופן בולט לטובת אנשים בהירי-עור. הבדיקה השוותה כמה מערכות מסחריות מובילות זו-לצד-זו, ומצאה שכולן דייקות משמעותית פחות על נשים כהות-עור מכל קבוצה אחרת — הרכב-הכשל החמור-ביותר-האפשרי מבחינת הצטלבות בין גזע למגדר גם-יחד.
בעקבות הפרסום, כמה מהחברות שנבדקו — בהן IBM ומיקרוסופט — עדכנו את מערכי-האימון שלהן ודיווחו על שיפור-דיוק, אחת הדוגמאות הבודדות שבהן מחקר-הטיה אקדמי הוביל לתיקון מוצרי מסחרי מתועד. Gender Shades הפך לדוגמה-היסוד המצוטטת ביותר בדיוני הטיה אלגוריתמית, ולזרז מרכזי בוויכוח הציבורי המתמשך על הפיקוח הנדרש על מערכות זיהוי-פנים לפני שהן נכנסות לשימוש בקנה-מידה ציבורי — ותרם ישירות להפיכת בדיקת-דיוק נפרדת לכל תת-קבוצה דמוגרפית לסטנדרט מקובל במחקר-AI, לא רק לרעיון תיאורטי.