מהי הפחתת רעש בדיבור?
הפחתת רעש בדיבור מקבלת אות שבו קול רצוי מעורב ברעש ומנסה להפיק אות שקל ונעים יותר לשמוע. היא אינה זהה להפרדת כל המקורות ואינה יכולה תמיד לשחזר מידע שהרעש הסתיר. מערכת עשויה לפעול על הקלטה או בזמן אמת בשיחה, ועשויה להיות מותאמת למיקרופון יחיד או לכמה מיקרופונים. כאן המקורות עוסקים בעיקר בדיכוי רעש חד־ערוצי ובפעולה בזמן אמת.
כיצד משלבים עיבוד אותות ולמידה עמוקה?
בגישה שעליה מבוססת RNNoise, רשת עצבית מעריכה מקדמי הגברה לפסי תדר קריטיים: כמה להחליש או לשמר בכל אזור של הספקטרום. מסנן גובה־צליל מסורתי מפחית רעש בין ההרמוניות של קול האדם. החלוקה מנצלת למידה כדי להעריך מסכה ועיבוד אותות כדי להשתמש במבנה הקולי. המחקר דיווח על מורכבות נמוכה מספיק לפעולה בזמן אמת ב־48 קילוהרץ על מעבד חסכוני.
מדוע נתוני האימון והבדיקה חשובים?
כדי לאמן מערכת דרושים דיבור נקי ודוגמאות רעש, שאותם מערבבים בתנאים שונים. מאגר סינתטי מאפשר לדעת מה היה אות הייחוס, אך אינו מכסה בהכרח חדרים, מיקרופונים והפרעות בעולם. מארגני אתגר DNS הזהירו שמודל עשוי להצליח בתערובות הדומות לנתוני האימון ולהיחלש בהקלטות אמיתיות. לכן מסגרת הבדיקה שלהם כללה גם תערובות סינתטיות וגם הקלטות מן העולם.
כיצד מודדים איכות?
מדדים אובייקטיביים משווים את הפלט לאות ייחוס או מעריכים עיוות, אבל אינם תמיד מתואמים היטב עם שיפוט אנושי. אתגר DNS השתמש במבחני האזנה מקוונים המבוססים על ITU-T P.808 ובחר זוכים לפי הערכה סובייקטיבית במאגר מייצג. צריך להפריד בין כמה שאלות: האם הרעש נחלש, האם הדיבור נשאר מובן, האם הקול נשמע טבעי, והאם המערכת עומדת בדרישות ההשהיה.
מה עלול להשתבש בשימוש?
דיכוי אגרסיבי עלול לבלוע עיצורים חלשים, ליצור צליל מתכתי או לשנות את גוון הקול. רעש שאינו דומה לנתוני האימון, כמה דוברים בו־זמנית או מוזיקה ברקע יכולים לבלבל בין אות רצוי להפרעה. מערכת בזמן אמת צריכה גם להימנע מהשהיה וקפיצות כאשר התנאים משתנים. לכן אין להסתפק בדוגמת לפני־ואחרי אחת: יש לבדוק קולות, רעשים, עוצמות ומכשירים מגוונים במסגרת השימוש המתוכננת.