ריבונות נתונים ילידית (Indigenous Data Sovereignty)

AI בחברה

הגדרה

התביעה של עמים ילידיים לשלוט בנתונים שנאספים עליהם, על שפתם ועל תרבותם, ולקבוע מי רשאי להשתמש בהם — ובכלל זה לאימון מערכות בינה מלאכותית.

מה נתבע כאן, ובידי מי

ריבונות נתונים ילידית עוסקת בשאלה מי מחליט אילו נתונים מיוצרים על עם יליד, כיצד הם משותפים ולשם מה. "נתונים ילידיים" הם רחבים: מפקדי אוכלוסין, נתוני בריאות ומינהל, מידע על הסביבה ועל משאבים, ומורשת תרבותית כמו היסטוריה שבעל פה, ידע שבטי ואתרים תרבותיים. הטענה המרכזית היא שנתונים כאלה, כשאין עליהם ממשל קהילתי, נוטים להציג את העם המדובר באופן מוטעה, להזין מדיניות בעלת השפעה מפלה, ולהנציח דפוסים קולוניאליים. בקנדה, למשל, חלק ניכר מהמידע על עמים ילידיים מסווג כנתוני ממשלה תחת זכויות יוצרים של הכתר, ובכך מוגבלת גישתם שלהם אליו. המושג נשען על הכרזת האומות המאוחדות בדבר זכויות עמים ילידיים משנת 2007, ועל מסגרות קהילתיות מוקדמות יותר כמו עקרונות OCAP של האומות הראשונות בקנדה. חשוב להבחין: זו תשובה קהילתית, שנכתבת בידי רשתות של עמים ילידיים, ולא מדיניות ממשלתית — וזה ההבדל בינה לבין בינה מלאכותית ריבונית, שהיא בעיקרה החלטת מדינה.

CARE לצד FAIR

ב-2019 ניסחה קבוצת העניין הבין-לאומית לריבונות נתונים ילידית, הפועלת במסגרת ברית מחקר הנתונים (Research Data Alliance), את עקרונות CARE לממשל נתונים ילידיים. ארבעת העקרונות הם תועלת קולקטיבית, סמכות לשלוט, אחריות ואתיקה. הם נכתבו כהשלמה לעקרונות FAIR של נתונים פתוחים ולא כתחליף להם: FAIR עוסק בנתונים — שיהיו ניתנים לאיתור, לגישה, לשילוב ולשימוש חוזר — ואילו CARE, בניסוח המאמר האקדמי שפרסם אותם, "מכוון לאנשים ולתכלית". הסיסמה שהמחברים בחרו היא שמי שמופקדים על נתונים ילידיים ומי שעושים בהם שימוש יהיו FAIR וגם CARE. העקרונות עצמם נשענים על עבודה מוקדמת של רשתות לאומיות — Te Mana Raraunga בניו זילנד, הרשת האמריקנית לריבונות נתונים ילידית, והקולקטיב האוסטרלי Maiam nayri Wingara.

מקרה מבחן: רישיון ה-Kaitiakitanga

ארגון התקשורת המאורי Te Hiku Media בצפון ניו זילנד פיתח מערכת זיהוי דיבור אוטומטי שמגיעה לדיוק של 92 אחוזים בשפה המאורית ו-82 אחוזים בדיבור דו-לשוני, ושחרר אותה תחת רישיון ה-Kaitiakitanga — מכשיר משפטי שקובע שהנתונים ישמשו רק לטובת העם המאורי. תנאי הרישיון מפורשים: יש לפנות לארגון ולבקש רשות לכל גישה, שימוש או שינוי בקוד, ואסור שימוש מסחרי אלא באישור מפורש. בפתיח שלו מנוסח הנימוק: "בכך שאנו פשוט פותחים את הנתונים ואת הידע שלנו כמקור פתוח, אנחנו מרשים לעצמנו להיות נתונים לקולוניזציה דיגיטלית בעולם המודרני".

למה זה נוגע דווקא לבינה מלאכותית

לפי IEEE Spectrum, אפשר לבקש מ-ChatGPT לכתוב בשפה המאורית והוא יענה שוטף — יכולת שנבנתה על טקסט ואודיו שהפיקו קהילות ואקדמאים מאורים, שנגרפו בלי רשותם, עובדו מחוץ לניו זילנד וחוזרים למשתמשים דרך ממשקים בבעלות חברות טכנולוגיה גדולות. פרופסור טה טאקה קיגן מאוניברסיטת ואיקאטו מנסח את הבעיה כך: "החברות האלה מעבר לים יכולות לייצר מודלים שעובדים טוב, אבל הן גרפו את כל הנתונים האלה בלי שום שיתוף מצדנו, ואנחנו לא בעלים של התוצר. השפה שלנו היא הכלי החשוב ביותר שיש לנו להעברת הידע שלנו". את השפה המאורית דוברים שוטף רק 4.3 אחוזים מאוכלוסיית ניו זילנד, והיא נחשבת שפה דלת-משאבים.

לא ארגון אחד, אלא שיטה

הרישיון נכתב כמסמך חי שימשיך להתפתח, ומטרתו המוצהרת היא לשמש דוגמה בין-לאומית לשמירת עמים ילידיים על סמכותם בנוגע לנתונים ולקניין רוחני בתוך מבנה מערבי. IEEE Spectrum מונה מיזמים נוספים באותה גישה: קיגן ותלמידו דאז קינגסלי אנג בנו קול סינתטי לניב מקומי של השפה המאורית מתוך פחות משמונה שעות הקלטה, וקיגן מנהל דיון עם שלושת השבטים שאליהם משתייכת הדוברת — לדבריו השמירה על הקול צריכה לשבת אצלם ולא אצל האוניברסיטה; מיזם Aina בברצלונה שחרר מערכת להמרת טקסט לדיבור רב-ניבית בקטלאנית; וביוזמת First Languages AI Reality בקוויבק נבנים מודלים לזיהוי דיבור בשפות ילידיות בצפון אמריקה.

שאלות נפוצות ❓

מה זה רישיון Kaitiakitanga?

רישיון תוכנה שכתב ארגון התקשורת המאורי Te Hiku Media, ולפיו יש לפנות לארגון ולקבל רשות לכל גישה, שימוש או שינוי בקוד, ואין להשתמש בו למטרות מסחריות אלא באישור מפורש. כל יצירה נגזרת כפופה לאותו רישיון. הנימוק שבפתיח: פתיחת הנתונים למקור פתוח היא, לשיטת הכותבים, המשך של קולוניזציה באמצעים דיגיטליים.

מה הם עקרונות CARE?

תועלת קולקטיבית, סמכות לשלוט, אחריות ואתיקה. הם נוסחו ב-2019 בידי קבוצת עניין בין-לאומית לריבונות נתונים ילידית ופורסמו רשמית ב-2020 בכתב-העת Data Science Journal.

איך CARE שונה מ-FAIR?

FAIR הוא מערך עקרונות שממוקד בנתונים עצמם — איתור, גישה, שילוב ושימוש חוזר. CARE, בלשון המאמר שפרסם אותו, מכוון לאנשים ולתכלית, והוא נכתב כהשלמה ל-FAIR ולא כתחליף לו.

מה הקשר לבינה מלאכותית?

מודלים גדולים כותבים היום בשפות ילידיות על סמך טקסט ואודיו שהפיקו הקהילות עצמן. לפי IEEE Spectrum, החומר המאורי נגרף בלי רשות, עובד מחוץ לניו זילנד, והתוצר אינו בבעלות הדוברים. הרישיון ועקרונות CARE הם ניסיון לשנות את שרשרת ההחלטות הזאת.

האם זה אותו דבר כמו בינה מלאכותית ריבונית?

לא. בינה מלאכותית ריבונית היא בעיקרה מדיניות של מדינה, עם תקציב ממשלתי ומכרזים — אף שבתעשייה משתמשים במונח גם לגבי גופים שאינם המדינה. ריבונות נתונים ילידית נתבעת בידי קהילות ורשתות של עמים ילידיים, ולעיתים קרובות דווקא מול המדינה שבתחומה הן חיות.