זיהוי תוכן שנוצר על ידי בינה מלאכותית

בטיחות ואתיקה

הגדרה

זיהוי תוכן שנוצר על ידי בינה מלאכותית הוא תחום הכלים והשיטות שמנסים לקבוע אם טקסט, תמונה, וידאו או קול נוצרו על ידי AI ולא על ידי אדם.

מה זה זיהוי תוכן-AI, ולמה זו בעיה קשה

זיהוי תוכן שנוצר על ידי בינה מלאכותית הוא תחום הכלים והשיטות שמנסים לקבוע אם טקסט, תמונה, וידאו או קול נוצרו על ידי AI ולא על ידי אדם. הצורך בכך גדל עם התפשטות כלי-AI גנרטיביים נגישים כמו ChatGPT ומחוללי-תמונות: מורים רוצים לדעת אם תלמיד כתב עבודה בעצמו, עיתונאים רוצים לאמת תיעוד, ומעסיקים רוצים לבדוק קורות-חיים. אלא שמחקר אקדמי עצמאי — Weber-Wulff ושותפיה, שפורסם בכתב-העת השפיט International Journal for Educational Integrity בדצמבר 2023 — בדק 14 כלי-זיהוי-טקסט נפוצים ומצא שכולם ניקדו מתחת ל-80% דיוק, וחמישה בלבד מעל 70%.

זיהוי טקסט: הטיה כלפי "אנושי", ופגיעה בדוברי אנגלית שאינה שפת-אם

כלי-זיהוי-טקסט נוטים בדרך כלל להטות את התוצאה לכיוון "כתוב בידי אדם" ולא לכיוון "נוצר על ידי AI" — כלומר יש להם יותר פספוסים (false negatives) מאשר האשמות-שווא (false positives), אך גם אלה קורות בפועל ובתדירות מדאיגה. מחקרים נוספים תיעדו שכלים כאלה מפלים לרעה טקסטים שנכתבו בידי דוברי אנגלית שאינה שפת-אם, ושעריכה קלה או תרגום-מכונה על טקסט אנושי-מקורי גורמים לכלים רבים "לפספס" ולסווג אותו כ-AI. תוצאה מעשית: מוסדות אקדמיים כמו קיימברידג' ואוניברסיטת טקסס באוסטין הפסיקו להשתמש בכלי-הזיהוי של Turnitin.

סימני-מים דיגיטליים: פתרון מבטיח, אבל לא פתרון-קסם

גישה חלופית לניסיון לזהות תוכן-AI בדיעבד היא הטבעת "סימן-מים" סטטיסטי בלתי-נראה בתוך הטקסט או התמונה כבר בזמן היצירה. מאמר אקדמי מ-2023 בשם "A Watermark for Large Language Models", שהציגו חוקרים מאוניברסיטת מרילנד בוועידת ICML, הראה שיטה להטביע בטקסט של מודל-שפה סימן שניתן לזהות בבדיקה סטטיסטית פשוטה, בלי לפגוע משמעותית באיכות הטקסט. עם זאת, מאמר-המשך מאותה שנה הדגים שהתקפות-ניסוח-מחדש (paraphrasing) יכולות להחליש משמעותית את יכולת הזיהוי של סימני-המים, בלי לפגוע הרבה באיכות הטקסט המנוסח-מחדש.

תמונה, וידאו וקול: אותה בעיה, כלים אחרים

בתחום התמונה והווידאו, כלי-זיהוי מתבססים בעיקר על רשתות-נוירונים שאומנו לזהות "טביעות-אצבע" סטטיסטיות שמשאירים אחריהם כלי-יצירה מסוימים — אך גם הם אינם אמינים לחלוטין, ומתקשים במיוחד מול תמונות שעברו דחיסה או עריכה נוספת. חברת Google DeepMind מפתחת מאז 2023 כלי בשם SynthID שמטביע סימן-מים בלתי-נראה לעין בפיקסלים של תמונה בזמן היצירה, בגישה דומה לסימני-המים הטקסטואליים. קואליציית תעשייתית בשם C2PA, שהקימו מיקרוסופט, Adobe וחברות נוספות, נוקטת גישה משלימה: לא ניסיון-זיהוי בדיעבד, אלא תיעוד-מוצא חתום מראש שמצורף לקובץ כבר בזמן יצירתו.

המדיניות הרשמית: הנחיית NIST האמריקאית

בנובמבר 2024 פרסם המכון הלאומי האמריקאי לתקנים וטכנולוגיה (NIST), דרך מכון-הבטיחות-של-AI האמריקאי (US AISI), את הגרסה הסופית של דו״ח-ההנחיה הראשון שלו בנושא — NIST AI 100-4: Reducing Risks Posed by Synthetic Content — שמתווה גישות וולונטריות להתמודדות עם סיכוני תוכן-AI כמו התחזות והונאה. הדו״ח פורסם כחלק ממאמץ בין-לאומי משותף שגייס למעלה מ-11 מיליון דולר למחקר בנושא, וממחיש שגם גופים רשמיים מכירים בכך שאין עדיין פתרון-זיהוי מלא וסופי — רק מכלול-כלים משלים.

שאלות נפוצות ❓

האם כלי-זיהוי-AI לטקסט אמינים?

לא לגמרי — מחקר מ-2023 שבדק 14 כלים מצא שכולם ניקדו מתחת ל-80% דיוק, וחמישה בלבד מעל 70%, עם נטייה להטות תוצאות לכיוון "אנושי".

מה זה סימן-מים דיגיטלי (watermark) בטקסט או בתמונה?

שיטה שמטביעה בתוכן חתימה סטטיסטית בלתי-נראית בזמן היצירה עצמה, כדי לאפשר זיהוי ודאי יותר בהמשך — לעומת ניסיון לזהות תוכן-AI בדיעבד בלי סימון מוקדם.

האם כלי-הזיהוי מפלים קבוצות מסוימות?

כן — מחקרים תיעדו שיעורי-האשמת-שווא גבוהים יותר כלפי טקסטים של דוברי אנגלית שאינה שפת-אם, מה שהוביל כמה מוסדות אקדמיים להפסיק להשתמש בכלים כאלה.

מה ההבדל בין זיהוי-תוכן-AI לתקן C2PA?

זיהוי-תוכן מנסה לקבוע בדיעבד אם תוכן קיים נוצר על ידי AI; C2PA הוא תקן שמצרף לקובץ מלכתחילה תיעוד-מוצא חתום, כך שאין צורך ב"ניחוש" מאוחר יותר.