טקסט-לדיבור (Text-to-Speech)
הגדרה
טקסט-לדיבור (Text-to-Speech) היא טכנולוגיה שהופכת טקסט כתוב לקול מדובר טבעי.
💡 דוגמה
מדביקים מאמר ארוך ושומעים אותו מוקרא בקול טבעי בזמן נהיגה.
טקסט-לדיבור (Text-to-Speech — TTS) הוא טכנולוגיה שהופכת טקסט כתוב לקול מדובר טבעי — הבסיס לכל דבר מקורא-מסך לנגישות ועד עוזרים קוליים ואווטארים מדברים. המערכת מקבלת מחרוזת-טקסט רגילה ומחזירה קובץ-שמע שנשמע כאילו אדם הקריא אותו בקול רם, תוך פחות משנייה במערכות מודרניות.
מערכות TTS מוקדמות — כמו אלה ששולבו במחשבי-הבית של שנות ה-80 וה-90 — נשמעו מכניות וקטועות באופן ברור, קל היה להבחין מיד שמדובר במחשב. המהפכה הגיעה ב-2016, כשחברת DeepMind (חברת-הבת של Google) פרסמה את WaveNet — רשת-נוירונים עמוקה שלמדה לייצר צליל-דיבור גולמי ישירות, גל-קול אחרי גל-קול, במקום להרכיב אותו מקטעי-הקלטה מוכנים-מראש כפי שעשו שיטות קודמות. הגישה הזו הניחה את הבסיס לדור הנוכחי של מודלים, שמייצרים דיבור עם אינטונציה, הדגשות וקצב שנשמעים כמעט זהים לדיבור אנושי אמיתי.
דוגמה קונקרטית ומרגשת: השחקן ג'יימס ארל ג'ונס, קולו המקורי של הדמות דארת' ויידר בסאגת מלחמת הכוכבים, חתם ב-2022 על הסכם עם Lucasfilm שהתיר שימוש בהקלטות-הארכיון של קולו כדי לייצר את קולה של הדמות באופן מלאכותי גם בעתיד. באותה שנה כבר שימש הקול-המשוחזר, שנוצר באמצעות תוכנת החברה האוקראינית Respeecher, בסדרת הטלוויזיה Obi-Wan Kenobi — וג'ונס עצמו הודיע שהוא פורש מהדיבוב הישיר של התפקיד. ג'ונס נפטר בספטמבר 2024 בגיל 93, אבל בזכות ההסכם קולו של דארת' ויידר ימשיך להישמע בפרויקטים עתידיים של הסאגה.
TTS הוא רכיב מרכזי בכל אפליקציית "שיחה קולית" עם AI — אחרי שהמודל "חושב" תשובה טקסטואלית, TTS הופך אותה לקול שמושמע בזמן אמת, לעיתים תוך כדי סנכרון עם אנימציית שפתיים (ראו הערך סנכרון שפתיים). אתגר שנותר פתוח הוא שפות עם פחות משאבי-אימון זמינים — כולל עברית, יחסית לאנגלית — שבהן איכות ה-TTS עדיין נשמעת פחות טבעית וסובלת מטעויות-הטעמה תכופות יותר, בעיקר במילים לא-שגרתיות או בשילובי-מספרים ותאריכים.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות