הפרדת מקורות שמע

תמונה, קול ווידאו

הגדרה

הפרדת מקורות שמע היא משימה חישובית שמעריכה רכיבי שמע נפרדים, כגון שירה, תופים ובס, מתוך הקלטה מעורבת.

מהי הפרדת מקורות שמע?

הפרדת מקורות שמע מנסה לפרק הקלטה מעורבת לאומדנים של הרכיבים שמהם נוצרה. במוזיקה נהוג לדבר על ערוצי שירה, תופים, בס וליווי נוסף, אך הפלט אינו שחזור מובטח של קובצי האולפן המקוריים. המודל מקבל את התערובת ומחשב לכל מקור אות משוער; באימון מונחה אפשר להשוות את האומדנים לערוצי ייחוס נפרדים ולשפר את ההפרדה.

באילו ייצוגים משתמשים?

מערכת יכולה לעבוד ישירות על צורת הגל, על ייצוג זמן־תדר כגון ספקטרוגרמה, או על שילוב ביניהם. Demucs המקורי ממפה גל קולי מעורב לגלים מופרדים באמצעות מבנה דמוי U-Net ורכיב חוזר. HT Demucs משלב ענף זמני וענף ספקטרלי ומעביר מידע ביניהם באמצעות מנגנוני קשב. הבחירה בייצוג משפיעה על המידע שהמודל רואה, אך אינה לבדה מבטיחה צליל טבעי.

כיצד מאמנים ובודקים מערכת?

מאגר MUSDB18 כולל 150 קטעים מלאים מכמה סוגות, עם תערובת וארבעה סוגי ערוצים מבודדים: תופים, בס, שירה וליווי אחר. הוא מחלק 100 קטעים לאימון ו־50 לבדיקה. ציונים מספריים כמו יחס אות לעיוות מאפשרים השוואה עקבית, אבל הם תלויים במאגר ובחלוקת המקורות. מחקר Demucs הוסיף גם האזנה אנושית, משום שעיוות שמפריע למאזין אינו תמיד מסוכם היטב במדד יחיד.

למה משתמשים בהפרדה?

ערוצים מופרדים מאפשרים להחליש שירה, לשנות איזון בין כלים, להכין גרסה לקריוקי, לנתח ביצוע או להזין שלב עיבוד נוסף. יישום בזמן אמת מוסיף אילוץ שאינו קיים בעיבוד לא־מקוון: המערכת חייבת להחזיר שמע במהירות מספקת בלי לצבור השהיה מורגשת. HS-TasNet, למשל, נבנתה לשילוב מידע ספקטרלי וזמני ובחנה במפורש פשרה בין איכות הפרדה, זמן חישוב והשהיה.

מהן המגבלות וכיצד מאזינים לפלט?

כאשר שני מקורות חולקים תדרים, נכנסים יחד באותו רגע או הוקלטו עם הדהוד, קשה לייחס כל רכיב למקור אחד. התוצאה עלולה לכלול זליגה של שירה לערוץ הליווי, חלקי כלי שנעלמו או צליל מתכתי. גם נתוני האימון חשובים: HT Demucs השתפר במחקר כאשר נוספו שירי אימון מעבר ל־MUSDB. לכן יש לבחון את הפלט בשיר ובשימוש הרצויים, ולא להסיק מציון מחקרי שההפרדה נקייה בכל הקלטה.

שאלות נפוצות ❓

מה מקבלים בסוף ההפרדה?

אומדנים של ערוצי המקור; ב-MUSDB אלה שירה, תופים, בס וליווי נוסף.

האם הערוצים זהים להקלטות האולפן?

אין הבטחה כזאת; תוארו זליגה ועיוותים.

האם כל המודלים עובדים על ספקטרוגרמה?

לא; Demucs המקורי עובד על צורת הגל, והגישה ההיברידית משלבת ייצוגים.

האם הפרדה בזמן אמת היא אותה בעיה?

היא מוסיפה מגבלות השהיה וזמן חישוב, כפי שנבחן ב-HS-TasNet.