המרת קול (Voice Conversion)

תמונה, קול ווידאו

הגדרה

המרת קול (Voice Conversion) היא החלפת זהות-הדובר בהקלטת-דיבור קיימת בזהות של אדם אחר, בלי לשנות את המילים שנאמרו.

מה זו המרת קול, ובמה היא שונה משיבוט קול

המרת קול (Voice Conversion) היא טכניקה שמקבלת הקלטת-דיבור קיימת ומחליפה בה את זהות-הדובר בזהותו של אדם אחר, בלי לגעת במילים שנאמרו. הסקירה האקדמית המרכזית בתחום, של סיסמן ושותפיה, מנסחת זאת כך: משנים את זהות-הדובר מאחד לאחר, תוך שמירה על התוכן הלשוני. ההבדל משיבוט קול מתחיל כבר בקלט. שיבוט קול מתחיל מטקסט כתוב ומקריא אותו בקולו של אדם מסוים; המרת קול מתחילה מדיבור אנושי אמיתי, ולכן שומרת גם על ההטעמה, הקצב והרגש של מי שדיבר בפועל — רק הזהות מתחלפת. בשיווק המסחרי שני הסוגים נמכרים לא-פעם תחת אותו שם, "שיבוט קול"; ההבחנה כאן היא לפי מה שנכנס למערכת.

איך זה עובד: להפריד בין מה שנאמר לבין מי אמר

האתגר המרכזי הוא הפרדה. המערכת צריכה להבחין באות-הדיבור בין מה ששייך לתוכן — ההברות עצמן — לבין מה ששייך לזהות הדובר, כמו גובה-הקול וגוון-הקול. אותה סקירה מפרקת את התהליך לשלבים: ניתוח אות-הדיבור, המרה של המאפיינים הספקטרליים, המרת ההטעמה, אפיון הדובר, ולבסוף שחזור גל-קול שמיע ברכיב שנקרא Vocoder — מקודד-קול, שתפקידו להרכיב מן המספרים חזרה צליל שאפשר לשמוע. בסיווג המקובל של זיופי-שמע, המרת קול נמנית עם משפחת השיטות מבוססות-החיקוי (Imitation-based) — שיטות שמשנות דיבור אנושי קיים במקום לייצר דיבור מאפס — ואלה נשענות לא-פעם על רשת יריבה גנרטיבית.

איפה זה כבר בשימוש: קולנוע ודיבוב

השימוש הגלוי ביותר הוא בקולנוע. בכלי של החברה האוקראינית Respeecher, שמאפשר לאדם אחד לדבר בקולו של אדם אחר מסוים, נוצר קולו של לוק סקייווקר בסדרה The Mandalorian ב-2020, וקולו של ריצ'רד ניקסון בסרט הקצר In Event of Moon Disaster מ-2019. שני אלה ממחישים מה מושך את הקולנוע לטכניקה הזו: היא נכנסת אל תוך ביצוע שכבר הוקלט ומחליפה בו רק את זהות-הקול, ולכן התזמון, ההטעמה והרגש נשארים של מי שדיבר. סיפור נוסף מאותו כלי, קולו של דארת' ויידר, מסופר בערך טקסט-לדיבור.

כמה טוב זה כבר עובד

את בשלות התחום מודדים בתחרות ייעודית, Voice Conversion Challenge. במהדורת 2020 הוגשו 33 מערכות, ובהן שלוש מערכות-בסיס של המארגנים, בשתי משימות: המרה בתוך אותה שפה, והמרה חוצת-שפות שבה הקלטות הדובר-היעד הן בשפה אחרת לגמרי. מבחני-ההאזנה העלו תמונה מעורבת: בכמה מהמערכות הדמיון לדובר-היעד הגיע לרמה של הדובר האמיתי עצמו, אך אף אחת מהן לא הגיעה לטבעיות ברמה אנושית באותה משימה.

למה זה נוגע לך

למי שחושש לקולו, ההבדל בין שתי הטכניקות הוא מעשי ולא אקדמי. שיבוט קול מפיק הקראה של טקסט; המרת קול מעבירה ביצוע אנושי חי — בהלה, היסוס, צחוק — לתוך קול אחר, ולכן מה שנשמע בה כטבעי אינו הישג של המודל אלא של האדם שדיבר בפועל. המסקנה איננה להימנע מלדבר; היא שקול לבדו כבר אינו אמצעי-זיהוי מספיק, ומה עושים עם זה בפועל מפורט בערך דיפ-פייק. על הצד השני של השאלה — מה בכלל אפשר לזהות אוטומטית — ראו זיהוי זיוף-קול.

טקסט-לדיבור מול שיבוט קול מול המרת קול
טקסט-לדיבורשיבוט קולהמרת קול
מה נכנס פנימהטקסט כתוב בלבדטקסט כתוב ודגימה מקול-היעדהקלטת-דיבור של אדם אחד ודגימה מקול-היעד
מי קובע הטעמה, קצב ורגשהמודל, מתוך הטקסטהמודל, מתוך הטקסטהאדם שדיבר בהקלטה המקורית
מה משתנה בתוצרנוצר דיבור חדש בקול כללינוצר דיבור חדש בקולו של אדם מסויםהמילים נשמרות, זהות-הדובר מתחלפת
שימוש טיפוסיהקראת טקסט ונגישותקריינות בקול מוכרדיבוב ושחזור-קול בקולנוע

שאלות נפוצות ❓

מה ההבדל בין המרת קול לשיבוט קול?

שיבוט קול מתחיל מטקסט כתוב ומקריא אותו בקולו של אדם מסוים; המרת קול מתחילה מהקלטת-דיבור קיימת ומחליפה בה רק את זהות-הדובר, כך שההטעמה, הקצב והרגש של הדובר המקורי נשמרים.

האם המילים שנאמרו משתנות בהמרת קול?

לא. שמירת התוכן הלשוני היא חלק מהגדרת הטכניקה — מה שמשתנה הוא מי נשמע כאומר אותן.

האם צריך שהדובר וקול-היעד יקליטו את אותם משפטים?

לא בהכרח. תחרות Voice Conversion Challenge של 2020 כללה גם משימה חוצת-שפות, שבה הקלטות הדובר-היעד היו בשפה אחרת לגמרי מזו של הדיבור שהומר.

האם אפשר לשמוע שקול הומר?

לפעמים, אבל אין להסתמך על כך. במבחני-ההאזנה של תחרות 2020 כמה מערכות הגיעו לדמיון-דובר ברמה של הדובר האמיתי, ואף אחת לא הגיעה לטבעיות ברמה אנושית — פער שנמדד אז, ואינו מבחן שאפשר לסמוך עליו היום.