מה נתבע כאן, ובידי מי
ריבונות נתונים ילידית עוסקת בשאלה מי מחליט אילו נתונים מיוצרים על עם יליד, כיצד הם משותפים ולשם מה. "נתונים ילידיים" הם רחבים: מפקדי אוכלוסין, נתוני בריאות ומינהל, מידע על הסביבה ועל משאבים, ומורשת תרבותית כמו היסטוריה שבעל פה, ידע שבטי ואתרים תרבותיים. הטענה המרכזית היא שנתונים כאלה, כשאין עליהם ממשל קהילתי, נוטים להציג את העם המדובר באופן מוטעה, להזין מדיניות בעלת השפעה מפלה, ולהנציח דפוסים קולוניאליים. בקנדה, למשל, חלק ניכר מהמידע על עמים ילידיים מסווג כנתוני ממשלה תחת זכויות יוצרים של הכתר, ובכך מוגבלת גישתם שלהם אליו. המושג נשען על הכרזת האומות המאוחדות בדבר זכויות עמים ילידיים משנת 2007, ועל מסגרות קהילתיות מוקדמות יותר כמו עקרונות OCAP של האומות הראשונות בקנדה. חשוב להבחין: זו תשובה קהילתית, שנכתבת בידי רשתות של עמים ילידיים, ולא מדיניות ממשלתית — וזה ההבדל בינה לבין בינה מלאכותית ריבונית, שהיא בעיקרה החלטת מדינה.
CARE לצד FAIR
ב-2019 ניסחה קבוצת העניין הבין-לאומית לריבונות נתונים ילידית, הפועלת במסגרת ברית מחקר הנתונים (Research Data Alliance), את עקרונות CARE לממשל נתונים ילידיים. ארבעת העקרונות הם תועלת קולקטיבית, סמכות לשלוט, אחריות ואתיקה. הם נכתבו כהשלמה לעקרונות FAIR של נתונים פתוחים ולא כתחליף להם: FAIR עוסק בנתונים — שיהיו ניתנים לאיתור, לגישה, לשילוב ולשימוש חוזר — ואילו CARE, בניסוח המאמר האקדמי שפרסם אותם, "מכוון לאנשים ולתכלית". הסיסמה שהמחברים בחרו היא שמי שמופקדים על נתונים ילידיים ומי שעושים בהם שימוש יהיו FAIR וגם CARE. העקרונות עצמם נשענים על עבודה מוקדמת של רשתות לאומיות — Te Mana Raraunga בניו זילנד, הרשת האמריקנית לריבונות נתונים ילידית, והקולקטיב האוסטרלי Maiam nayri Wingara.
מקרה מבחן: רישיון ה-Kaitiakitanga
ארגון התקשורת המאורי Te Hiku Media בצפון ניו זילנד פיתח מערכת זיהוי דיבור אוטומטי שמגיעה לדיוק של 92 אחוזים בשפה המאורית ו-82 אחוזים בדיבור דו-לשוני, ושחרר אותה תחת רישיון ה-Kaitiakitanga — מכשיר משפטי שקובע שהנתונים ישמשו רק לטובת העם המאורי. תנאי הרישיון מפורשים: יש לפנות לארגון ולבקש רשות לכל גישה, שימוש או שינוי בקוד, ואסור שימוש מסחרי אלא באישור מפורש. בפתיח שלו מנוסח הנימוק: "בכך שאנו פשוט פותחים את הנתונים ואת הידע שלנו כמקור פתוח, אנחנו מרשים לעצמנו להיות נתונים לקולוניזציה דיגיטלית בעולם המודרני".
למה זה נוגע דווקא לבינה מלאכותית
לפי IEEE Spectrum, אפשר לבקש מ-ChatGPT לכתוב בשפה המאורית והוא יענה שוטף — יכולת שנבנתה על טקסט ואודיו שהפיקו קהילות ואקדמאים מאורים, שנגרפו בלי רשותם, עובדו מחוץ לניו זילנד וחוזרים למשתמשים דרך ממשקים בבעלות חברות טכנולוגיה גדולות. פרופסור טה טאקה קיגן מאוניברסיטת ואיקאטו מנסח את הבעיה כך: "החברות האלה מעבר לים יכולות לייצר מודלים שעובדים טוב, אבל הן גרפו את כל הנתונים האלה בלי שום שיתוף מצדנו, ואנחנו לא בעלים של התוצר. השפה שלנו היא הכלי החשוב ביותר שיש לנו להעברת הידע שלנו". את השפה המאורית דוברים שוטף רק 4.3 אחוזים מאוכלוסיית ניו זילנד, והיא נחשבת שפה דלת-משאבים.
לא ארגון אחד, אלא שיטה
הרישיון נכתב כמסמך חי שימשיך להתפתח, ומטרתו המוצהרת היא לשמש דוגמה בין-לאומית לשמירת עמים ילידיים על סמכותם בנוגע לנתונים ולקניין רוחני בתוך מבנה מערבי. IEEE Spectrum מונה מיזמים נוספים באותה גישה: קיגן ותלמידו דאז קינגסלי אנג בנו קול סינתטי לניב מקומי של השפה המאורית מתוך פחות משמונה שעות הקלטה, וקיגן מנהל דיון עם שלושת השבטים שאליהם משתייכת הדוברת — לדבריו השמירה על הקול צריכה לשבת אצלם ולא אצל האוניברסיטה; מיזם Aina בברצלונה שחרר מערכת להמרת טקסט לדיבור רב-ניבית בקטלאנית; וביוזמת First Languages AI Reality בקוויבק נבנים מודלים לזיהוי דיבור בשפות ילידיות בצפון אמריקה.