זיהוי זיוף-קול (Audio Deepfake Detection)

תמונה, קול ווידאו

הגדרה

זיהוי זיוף-קול (Audio Deepfake Detection) הוא תחום השיטות שמנסות לקבוע אם הקלטת-דיבור הופקה במכונה או נאמרה בפועל בידי אדם.

מה נחשב זיוף-קול, ומה המערכת מחפשת

הספרות מונה שלוש משפחות של זיוף-קול: השמעה חוזרת של הקלטה אמיתית כדי לעבור מנגנון-אימות, דיבור שנוצר מאפס מתוך טקסט, ולבסוף המרת קול, כלומר החלפת זהות-הדובר בהקלטה קיימת. מערכת זיהוי זיוף-קול (Audio Deepfake Detection) אינה בודקת מה נאמר ואינה שופטת אם הדברים נכונים; היא מסווגת את ההקלטה לאחת משתי מחלקות בלבד, אותנטית (bona fide) או מזויפת (spoof). היא עושה זאת בשלושה שלבים: המרת גל-הקול למאפיינים מספריים, הרצה במודל שאומן להבדיל ביניהם, והכרעה. מה שהמודל מחפש אינו תוכן אלא עקבות שמשאיר אחריו תהליך-ההפקה.

ASVspoof — מבחן-האמת המשותף של התחום

מאז 2015 מתנהלת סדרת-התחרויות ASVspoof, ראשי-תיבות של Automatic Speaker Verification Spoofing and Countermeasures Challenge. אחרי המהדורות של 2015, 2017, 2019 ו-2021 הגיעה המהדורה החמישית, ASVspoof 5, שתוארה במאמר מ-2024. היא נבנתה מהקלטות שנאספו במיקור-המונים ממספר גדול בהרבה של דוברים ובתנאי-הקלטה מגוונים, ולראשונה שולבו בה גם התקפות יריבות (adversarial attacks) — קלט ששונה בכוונה בשינויים קטנים שמטרתם להטעות את מערכת-הזיהוי עצמה, ולא את מי שמאזין.

מה שעובד במעבדה לא בהכרח עובד בשטח

מחקר מרכזי בשאלה כמה אפשר לסמוך על הזיהוי הוצג בכנס Interspeech ב-2022. החוקרים אספו מאגר של 37.9 שעות הקלטות של ידוענים ופוליטיקאים, ומתוכן 17.2 שעות מזויפות, והריצו עליו מערכות-זיהוי שהצליחו במבחנים המקובלים. הביצועים קרסו — הידרדרות של עד אלף אחוזים. במילים פשוטות: כלים שעברו בהצלחה את מבחני-התקן נכשלו על הקלטות שנלקחו מהעולם האמיתי. מסקנת החוקרים הייתה שייתכן שהתחום התאים את פתרונותיו קרוב מדי למדד ASVspoof, ושזיהוי מחוץ למעבדה קשה בהרבה ממה שסברו.

שני פערים שמקטינים את הביטחון: שפה וקצב

הפער הראשון הוא שפה. רוב מחקרי-הזיהוי מתמקדים באנגלית, המחקר בשפות מדוברות אחרות מצומצם בהרבה, ומודל שאומן על אנגלית מציג ביצועים ירודים יותר על שמע בשפות אחרות; גם מבטא משפיע על הדיוק. לקורא העברי זו נקודה מעשית, לא הערת-שוליים. הפער השני הוא קצב-ההשתנות. בדיווח על ASVspoof 5 נמסר שההתקפות פגעו משמעותית במערכות-הבסיס, ולצד זאת שההגשות לתחרות הביאו שיפור ניכר — שני חצאים של אותו משפט, ושניהם נכונים. מערכות-הבסיס אינן מיטב-הטכנולוגיה אלא נקודת-ייחוס קבועה שנבחרה מראש, ולכן מה שקורה להן מודד כמה השתנה מגרש-המשחקים, לא כמה טוב אפשר לשחק בו.

ומה עושים עם זה בפועל

המסקנה המעשית היא לא להתייחס לכלי-זיהוי כאל הוכחה אלא כאל אינדיקציה אחת מיני כמה. הוועדה הפדרלית לסחר האמריקאית (FTC) הכריזה ב-8 באפריל 2024 על זוכי תחרות שיזמה בנושא שיבוט קול; הזוכים מקרב הארגונים הקטנים חלקו ביניהם פרס של 35,000 דולר. אחת ההצעות, OriginStory, מאמתת מקור אנושי בזמן ההקלטה עצמה, בעזרת חיישנים המצויים כבר במכשירים רבים שמודדים במקביל את אקוסטיקת-הדיבור ואת האותות הביולוגיים בגרון ובפה של הדובר, ומטביעה בהקלטה מה שה-FTC מתאר כסוג של סימן מים. זו הגישה ההפוכה לזיהוי בדיעבד — לסמן את המקור ברגע היווצרותו, כפי שעושה גם תקן C2PA. מה עושים כשמגיעה אליכם הקלטה חשודה מפורט בערך דיפ-פייק.

שאלות נפוצות ❓

יש כלי שאפשר להעלות אליו הקלטה ולקבל תשובה ודאית?

לא. כלי-זיהוי מחזיר הערכה, לא הוכחה. מחקר שהוצג ב-2022 הראה שמערכות שהצליחו במבחנים המקובלים התדרדרו בעד אלף אחוזים על הקלטות אמיתיות של ידוענים ופוליטיקאים — כלומר כלים שעברו את מבחני-התקן נכשלו על הקלטות מהעולם האמיתי.

למה כלי שמצליח במבחנים נכשל דווקא על הקלטה מהחיים?

מפני שהמבחנים המקובלים בנויים מהקלטות מבוקרות. חוקרים העלו את האפשרות שהתחום התאים את פתרונותיו קרוב מדי למדד ASVspoof, ולכן הביצועים על שמע מהעולם האמיתי נמוכים בהרבה.

האם הזיהוי עובד גם בעברית?

פחות טוב. רוב המחקר בתחום נעשה על אנגלית, המחקר בשפות אחרות מצומצם בהרבה, ומודל שאומן על אנגלית מציג ביצועים ירודים יותר על שמע בשפות אחרות; גם מבטא משפיע על הדיוק.

מה זה ASVspoof?

סדרת-תחרויות שרצה מאז 2015 ומשמשת מדד משותף לתחום: שמה המלא Automatic Speaker Verification Spoofing and Countermeasures Challenge, והמהדורה החמישית שלה תוארה במאמר מ-2024 — ובה, לראשונה בסדרה, גם התקפות יריבות (adversarial attacks), קלט ששונה בכוונה כדי להטעות את מערכת-הזיהוי.