טקסט-לדיבור (Text-to-Speech)

תמונה, קול ווידאו

טקסט-לדיבור (Text-to-Speech, TTS) היא טכנולוגיה שהופכת טקסט כתוב לקול מדובר טבעי — הבסיס לכל דבר מקורא-מסך לנגישות, ועד עוזרים קוליים ואווטארים מדברים.

מערכות TTS מוקדמות נשמעו מכניות וקטועות באופן ברור — קל היה להבחין שמדובר במחשב. מודלים מבוססי-למידה-עמוקה מודרניים מייצרים דיבור טבעי מאוד, עם אינטונציה, הדגשות, וקצב שנשמעים כמעט זהים לדיבור אנושי אמיתי.

TTS הוא רכיב מרכזי בכל אפליקציית "שיחה קולית" עם AI — אחרי שהמודל "חושב" תשובה טקסטואלית, TTS הופך אותה לקול שמושמע בזמן אמת, לעיתים תוך כדי סנכרון עם אנימציית שפתיים.