הבעיה: מי מתייג את הנתונים, ובכמה
מאחורי כל מודל שפה גדול עומדת עבודה אנושית של תיוג, ניקוי ואימות נתונים. לפי כתבה של Billy Perrigo במגזין TIME, ענף עיבוד-הנתונים לאימון AI שווה בעולם למעלה משני מיליארד דולר בשנת 2022, ונאמד שיגיע לכ-17 מיליארד דולר עד 2030. חלק ניכר מן ההכנסה הזאת אינו מגיע לעובדים בהודו, בקניה ובפיליפינים שמבצעים את העבודה בפועל: ענף העברת-העבודה (labor arbitrage) נוטה לשלם שכר הקרוב למינימום החוקי המקומי, בעוד הנתונים נמכרים ללקוחות זרים במחיר גבוה בהרבה. רכש-נתונים אחראי הוא הכינוי לניסיון לבנות תחום שלם, עם עקרונות ומנגנון-הסמכה משלו, שיחליף את הדפוס הזה — לא רק מודל של חברה אחת.
Karya: מקרה-מבחן אחד
Karya, ארגון ללא-כוונת-רווח שהושק ב-2021 בבנגלורו בידי מאנו צ'ופרה (Manu Chopra), ויוק סשאדרי (Vivek Seshadri) וספיה חוסיין (Safiya Husain) לאחר ארבע שנות מחקר במיקרוסופט ריסרץ' (Microsoft Research; מיקרוסופט עצמה אינה מחזיקה מניות בו), משלם לעובדים שכר-שעה של כ-5 דולר — פי-כ-20 משכר-המינימום ההודי — ומעביר את הכסף לחשבון הבנק תוך שעות ספורות. יש תקרת-הכנסה: ברגע שעובד מגיע לכ-1,500 דולר, סכום הקרוב להכנסה השנתית הממוצעת בהודו, הוא "מפנה מקום למישהו אחר". הייחוד של המודל הוא שהעובדים מקבלים גם בעלות בפועל על הנתונים שיצרו: בכל מכירה חוזרת של מאגר-נתונים, מלוא ההכנסה מחולקת ביניהם לפי שעות-העבודה. אבל נכון למועד הכתבה, המודל עדיין בתחילת דרכו — לפי TIME, אף לא אחד מ-30,000 עובדי Karya הגיע אז לתקרת ה-1,500 דולר, וה-116,000 דולר שכבר חולקו בתמלוגים הגיעו לכ-4,000 עובדים בלבד.
מקרה-הנגד: Sama וקניה
אל מול Karya מציבה הכתבה את Sama, חברת מיקור-חוץ שביצעה עבודה עבור ChatGPT של OpenAI ופייסבוק של מטא, ושגם היא שיווקה את עצמה כדרך "אתית" להוציא אנשים בדרום הגלובלי מעוני. עובדים קנייתים שביצעו עבורה מיון-תוכן עבור ChatGPT הרוויחו לעיתים פחות משני דולר לשעה, וסיפרו לכתב ה-TIME שנחשפו לתוכן-אימון טראומטי. הניגוד בין שני המודלים — שכר גבוה מול נמוך, בעלות על הנתונים מול היעדרה — הוא בדיוק מה שהתחום של רכש-נתונים אחראי מנסה להבטיח שלא יישאר שרירותי, אלא ייבדק ויוסמך.
התחום, לא רק המודל: Partnership on AI
רכש-נתונים אחראי אינו מוגבל לארגון אחד. Partnership on AI — ברית של חברות טכנולוגיה, ארגוני-מחקר וחברה אזרחית — מפעילה מסלול-עבודה בשם Responsible Sourcing Across the Data Supply Line, ופיתחה כלים לרכש-נתונים אחראי בשיתוף עם DeepMind החל מנובמבר 2022. ההנחיות שהמסלול מפרסם — תבניות לדיווח שקוף ולהתקשרות מול ספקים — מיועדות במפורש למי שקונה נתוני-אימון: מהנדסים, מדעני-נתונים ומנהלי-מוצר, כלומר לצד שיש לו בפועל את הכוח לשנות את תנאי ההעסקה בשרשרת האספקה, ולא רק למי שמוכר אותם.
התחום, לא רק המודל: Fairwork ועקרונותיו
Fairwork, שהחל כמיזם מחקר של מכון האינטרנט באוניברסיטת אוקספורד ומרכז המדעים החברתיים בברלין WZB, הפך לגוף הסמכה עצמאי שמפעיל חמישה עקרונות — שכר הוגן, תנאים הוגנים, חוזים הוגנים, ניהול הוגן וייצוג הוגן — ומדרג לפיהם שרשראות אספקה של עבודת-נתונים; לפי הארגון עצמו, הצוות שמאחוריו בדק לאורך השנים תנאי-עבודה במאות חברות ביותר מ-40 מדינות. Sama עצמה, שהערך הזה מציג כמקרה-הנגד, נבדקה על-ידי Fairwork במסגרת הדוח הראשון שלו על AI. הטענה המרכזית של התחום מנוסחת אצל קליקה באלי (Kalika Bali), חוקרת ראשית במיקרוסופט ריסרץ' וחברה בלתי-בשכר במועצת הפיקוח של Karya: לדבריה, שכר הוגן משתקף גם באיכות הנתונים עצמם — היא מקבלת מ-Karya נתונים בשיעור שגיאה של פחות מאחוז אחד, "וזה כמעט אף פעם לא המצב עם נתונים שאיתם אנחנו בונים מודלים".