מה זו המרת קול, ובמה היא שונה משיבוט קול
המרת קול (Voice Conversion) היא טכניקה שמקבלת הקלטת-דיבור קיימת ומחליפה בה את זהות-הדובר בזהותו של אדם אחר, בלי לגעת במילים שנאמרו. הסקירה האקדמית המרכזית בתחום, של סיסמן ושותפיה, מנסחת זאת כך: משנים את זהות-הדובר מאחד לאחר, תוך שמירה על התוכן הלשוני. ההבדל משיבוט קול מתחיל כבר בקלט. שיבוט קול מתחיל מטקסט כתוב ומקריא אותו בקולו של אדם מסוים; המרת קול מתחילה מדיבור אנושי אמיתי, ולכן שומרת גם על ההטעמה, הקצב והרגש של מי שדיבר בפועל — רק הזהות מתחלפת. בשיווק המסחרי שני הסוגים נמכרים לא-פעם תחת אותו שם, "שיבוט קול"; ההבחנה כאן היא לפי מה שנכנס למערכת.
איך זה עובד: להפריד בין מה שנאמר לבין מי אמר
האתגר המרכזי הוא הפרדה. המערכת צריכה להבחין באות-הדיבור בין מה ששייך לתוכן — ההברות עצמן — לבין מה ששייך לזהות הדובר, כמו גובה-הקול וגוון-הקול. אותה סקירה מפרקת את התהליך לשלבים: ניתוח אות-הדיבור, המרה של המאפיינים הספקטרליים, המרת ההטעמה, אפיון הדובר, ולבסוף שחזור גל-קול שמיע ברכיב שנקרא Vocoder — מקודד-קול, שתפקידו להרכיב מן המספרים חזרה צליל שאפשר לשמוע. בסיווג המקובל של זיופי-שמע, המרת קול נמנית עם משפחת השיטות מבוססות-החיקוי (Imitation-based) — שיטות שמשנות דיבור אנושי קיים במקום לייצר דיבור מאפס — ואלה נשענות לא-פעם על רשת יריבה גנרטיבית.
איפה זה כבר בשימוש: קולנוע ודיבוב
השימוש הגלוי ביותר הוא בקולנוע. בכלי של החברה האוקראינית Respeecher, שמאפשר לאדם אחד לדבר בקולו של אדם אחר מסוים, נוצר קולו של לוק סקייווקר בסדרה The Mandalorian ב-2020, וקולו של ריצ'רד ניקסון בסרט הקצר In Event of Moon Disaster מ-2019. שני אלה ממחישים מה מושך את הקולנוע לטכניקה הזו: היא נכנסת אל תוך ביצוע שכבר הוקלט ומחליפה בו רק את זהות-הקול, ולכן התזמון, ההטעמה והרגש נשארים של מי שדיבר. סיפור נוסף מאותו כלי, קולו של דארת' ויידר, מסופר בערך טקסט-לדיבור.
כמה טוב זה כבר עובד
את בשלות התחום מודדים בתחרות ייעודית, Voice Conversion Challenge. במהדורת 2020 הוגשו 33 מערכות, ובהן שלוש מערכות-בסיס של המארגנים, בשתי משימות: המרה בתוך אותה שפה, והמרה חוצת-שפות שבה הקלטות הדובר-היעד הן בשפה אחרת לגמרי. מבחני-ההאזנה העלו תמונה מעורבת: בכמה מהמערכות הדמיון לדובר-היעד הגיע לרמה של הדובר האמיתי עצמו, אך אף אחת מהן לא הגיעה לטבעיות ברמה אנושית באותה משימה.
למה זה נוגע לך
למי שחושש לקולו, ההבדל בין שתי הטכניקות הוא מעשי ולא אקדמי. שיבוט קול מפיק הקראה של טקסט; המרת קול מעבירה ביצוע אנושי חי — בהלה, היסוס, צחוק — לתוך קול אחר, ולכן מה שנשמע בה כטבעי אינו הישג של המודל אלא של האדם שדיבר בפועל. המסקנה איננה להימנע מלדבר; היא שקול לבדו כבר אינו אמצעי-זיהוי מספיק, ומה עושים עם זה בפועל מפורט בערך דיפ-פייק. על הצד השני של השאלה — מה בכלל אפשר לזהות אוטומטית — ראו זיהוי זיוף-קול.