רכש-נתונים אחראי (Responsible Data Sourcing)

AI בחברה

הגדרה

מודל תגמול בשרשרת תיוג-הנתונים, ותחום שלם סביבו של עקרונות והסמכה, שמנסים להבטיח לעובדים שכר הוגן ובעלות על התוצר; Karya ההודית היא מקרה-מבחן, ו-Sama מקרה-הנגד.

הבעיה: מי מתייג את הנתונים, ובכמה

מאחורי כל מודל שפה גדול עומדת עבודה אנושית של תיוג, ניקוי ואימות נתונים. לפי כתבה של Billy Perrigo במגזין TIME, ענף עיבוד-הנתונים לאימון AI שווה בעולם למעלה משני מיליארד דולר בשנת 2022, ונאמד שיגיע לכ-17 מיליארד דולר עד 2030. חלק ניכר מן ההכנסה הזאת אינו מגיע לעובדים בהודו, בקניה ובפיליפינים שמבצעים את העבודה בפועל: ענף העברת-העבודה (labor arbitrage) נוטה לשלם שכר הקרוב למינימום החוקי המקומי, בעוד הנתונים נמכרים ללקוחות זרים במחיר גבוה בהרבה. רכש-נתונים אחראי הוא הכינוי לניסיון לבנות תחום שלם, עם עקרונות ומנגנון-הסמכה משלו, שיחליף את הדפוס הזה — לא רק מודל של חברה אחת.

Karya: מקרה-מבחן אחד

Karya, ארגון ללא-כוונת-רווח שהושק ב-2021 בבנגלורו בידי מאנו צ'ופרה (Manu Chopra), ויוק סשאדרי (Vivek Seshadri) וספיה חוסיין (Safiya Husain) לאחר ארבע שנות מחקר במיקרוסופט ריסרץ' (Microsoft Research; מיקרוסופט עצמה אינה מחזיקה מניות בו), משלם לעובדים שכר-שעה של כ-5 דולר — פי-כ-20 משכר-המינימום ההודי — ומעביר את הכסף לחשבון הבנק תוך שעות ספורות. יש תקרת-הכנסה: ברגע שעובד מגיע לכ-1,500 דולר, סכום הקרוב להכנסה השנתית הממוצעת בהודו, הוא "מפנה מקום למישהו אחר". הייחוד של המודל הוא שהעובדים מקבלים גם בעלות בפועל על הנתונים שיצרו: בכל מכירה חוזרת של מאגר-נתונים, מלוא ההכנסה מחולקת ביניהם לפי שעות-העבודה. אבל נכון למועד הכתבה, המודל עדיין בתחילת דרכו — לפי TIME, אף לא אחד מ-30,000 עובדי Karya הגיע אז לתקרת ה-1,500 דולר, וה-116,000 דולר שכבר חולקו בתמלוגים הגיעו לכ-4,000 עובדים בלבד.

מקרה-הנגד: Sama וקניה

אל מול Karya מציבה הכתבה את Sama, חברת מיקור-חוץ שביצעה עבודה עבור ChatGPT של OpenAI ופייסבוק של מטא, ושגם היא שיווקה את עצמה כדרך "אתית" להוציא אנשים בדרום הגלובלי מעוני. עובדים קנייתים שביצעו עבורה מיון-תוכן עבור ChatGPT הרוויחו לעיתים פחות משני דולר לשעה, וסיפרו לכתב ה-TIME שנחשפו לתוכן-אימון טראומטי. הניגוד בין שני המודלים — שכר גבוה מול נמוך, בעלות על הנתונים מול היעדרה — הוא בדיוק מה שהתחום של רכש-נתונים אחראי מנסה להבטיח שלא יישאר שרירותי, אלא ייבדק ויוסמך.

התחום, לא רק המודל: Partnership on AI

רכש-נתונים אחראי אינו מוגבל לארגון אחד. Partnership on AI — ברית של חברות טכנולוגיה, ארגוני-מחקר וחברה אזרחית — מפעילה מסלול-עבודה בשם Responsible Sourcing Across the Data Supply Line, ופיתחה כלים לרכש-נתונים אחראי בשיתוף עם DeepMind החל מנובמבר 2022. ההנחיות שהמסלול מפרסם — תבניות לדיווח שקוף ולהתקשרות מול ספקים — מיועדות במפורש למי שקונה נתוני-אימון: מהנדסים, מדעני-נתונים ומנהלי-מוצר, כלומר לצד שיש לו בפועל את הכוח לשנות את תנאי ההעסקה בשרשרת האספקה, ולא רק למי שמוכר אותם.

התחום, לא רק המודל: Fairwork ועקרונותיו

Fairwork, שהחל כמיזם מחקר של מכון האינטרנט באוניברסיטת אוקספורד ומרכז המדעים החברתיים בברלין WZB, הפך לגוף הסמכה עצמאי שמפעיל חמישה עקרונות — שכר הוגן, תנאים הוגנים, חוזים הוגנים, ניהול הוגן וייצוג הוגן — ומדרג לפיהם שרשראות אספקה של עבודת-נתונים; לפי הארגון עצמו, הצוות שמאחוריו בדק לאורך השנים תנאי-עבודה במאות חברות ביותר מ-40 מדינות. Sama עצמה, שהערך הזה מציג כמקרה-הנגד, נבדקה על-ידי Fairwork במסגרת הדוח הראשון שלו על AI. הטענה המרכזית של התחום מנוסחת אצל קליקה באלי (Kalika Bali), חוקרת ראשית במיקרוסופט ריסרץ' וחברה בלתי-בשכר במועצת הפיקוח של Karya: לדבריה, שכר הוגן משתקף גם באיכות הנתונים עצמם — היא מקבלת מ-Karya נתונים בשיעור שגיאה של פחות מאחוז אחד, "וזה כמעט אף פעם לא המצב עם נתונים שאיתם אנחנו בונים מודלים".

שאלות נפוצות ❓

מה זה בכלל 'רכש-נתונים אחראי'?

כינוי לניסיון לבנות תחום שלם — לא רק חברה אחת — עם עקרונות ומנגנון-הסמכה, שמחליף את הדפוס הרגיל של תיוג-נתונים בשכר צמוד-מינימום. הרקע הוא ענף שעל פי TIME שוויו עלה מלמעלה משני מיליארד דולר ב-2022 ונאמד בכ-17 מיליארד דולר עד 2030, בעוד השכר בקצה השרשרת נשאר קרוב למינימום החוקי המקומי.

האם Karya כבר הוכיחה שהמודל עובד?

חלקית. שכר-השעה גבוה בהרבה מהתחרות ומגיע תוך שעות, אבל נכון לכתבה שעליה מבוסס הערך, אף לא אחד מ-30,000 עובדי Karya הגיע אז לתקרת ה-1,500 דולר שמסמנת סיום ההשתתפות, וה-116,000 דולר שכבר חולקו בתמלוגים הגיעו לכ-4,000 עובדים בלבד.

מה ההבדל בין Karya ל-Sama?

שתיהן שיווקו את עצמן כדרך אתית להוציא עובדים בדרום הגלובלי מעוני, אבל Karya משלמת כ-5 דולר לשעה ומעניקה בעלות על הנתונים, בעוד עובדי Sama בקניה שביצעו מיון-תוכן עבור ChatGPT הרוויחו לעיתים פחות משני דולר לשעה ונחשפו לתוכן טראומטי.

האם יש תקן או גוף שמפקח על התחום כולו, לא רק על חברה אחת?

כן. Partnership on AI מפרסמת הנחיות מעשיות שמכוונות למי שקונה נתוני-אימון, לא רק למי שמוכר אותם, ו-Fairwork, שהחל כמיזם מחקר באוקספורד וב-WZB בברלין, מפעיל חמישה עקרונות ומדרג לפיהם חברות — ואף בדק את Sama עצמה, שמוצגת כאן כמקרה-הנגד.

מה הטענה של התחום מעבר לשאלת הצדק?

שתנאי-ההעסקה אינם רק שאלה מוסרית אלא משתנה באיכות המוצר. לפי קליקה באלי, חוקרת במיקרוסופט ריסרץ' וחברה במועצת הפיקוח של Karya, היא מקבלת משם נתונים בשיעור שגיאה של פחות מאחוז אחד — רמה שלדבריה כמעט אף פעם לא מתקיימת בנתונים שנאספים בתנאים אחרים. זו הטענה ש-Partnership on AI ו-Fairwork מנסים להפוך לניתנת-לבדיקה בכל שרשרת אספקה, ולא רק אצל ספק אחד.