דיבור-לטקסט (Speech-to-Text)
הגדרה
דיבור-לטקסט (Speech-to-Text) היא טכנולוגיה שהופכת דיבור מוקלט לטקסט כתוב.
💡 דוגמה
מכתיבים לטלפון הודעה במקום להקליד, והיא מופיעה כטקסט. בעברית, עם שמות ומונחים מקצועיים, עדיין יש יותר טעויות.
דיבור-לטקסט (Speech-to-Text — STT) הוא טכנולוגיה שהופכת דיבור מוקלט לטקסט כתוב — הכיוון ההפוך מטקסט-לדיבור, והבסיס לתמלול אוטומטי ולכל שיחה קולית עם AI. המערכת מקבלת קובץ-שמע או זרם-שמע חי, ומחזירה טקסט כתוב שמייצג במדויק (ברוב-המקרים) את מה שנאמר, כולל סימני-פיסוק וזיהוי-דוברים במערכות מתקדמות.
כשמדברים בקול אל עוזר AI, הצעד הראשון תמיד הוא STT: הקול מומר לטקסט, ורק אז המודל "מבין" ומעבד את הבקשה כאילו הוקלדה. איכות ה-STT — כולל התמודדות עם רעש רקע, מבטאים, ומספר דוברים — משפיעה ישירות על איכות כל השיחה שאחריה, כי כל טעות-תמלול בשלב הזה מתגלגלת לכל התהליך שבא אחריה. איכות המודל נמדדת בדרך-כלל לפי שיעור-שגיאת-מילים (Word Error Rate — WER): אחוז המילים שתועתקו לא-נכון מתוך כלל המילים שנאמרו בפועל — ככל שהוא נמוך יותר, כך התמלול מדויק יותר.
דוגמה קונקרטית: Whisper, מודל-הקוד-הפתוח ש-OpenAI פרסמה בספטמבר 2022, אומן על 680,000 שעות של שמע-מתומלל שנאסף מהאינטרנט, מתוכן כ-117,000 שעות ב-96 שפות שאינן אנגלית — היקף-נתונים שהפך אותו למדויק במיוחד גם בשפות שמודלים קודמים התקשו בהן. Whisper הפך לרכיב-תשתית נפוץ בכלי-תמלול רבים בזכות היותו קוד-פתוח וחינמי, אך גם הדגים בעיה מוכרת: מחקרים עצמאיים מצאו שהוא "ממציא" לעיתים משפטים שלמים שלא נאמרו כלל בהקלטה המקורית — תופעת הזיה שמוכרת גם ממודלי-שפה טקסטואליים.
מודלי STT מודרניים תומכים ביותר ויותר שפות ומבטאים באיכות גבוהה, אבל שפות עם פחות חומר-אימון זמין — כולל עברית, יחסית לאנגלית — עדיין נוטות להציג יותר טעויות תמלול, במיוחד במונחים מקצועיים, שמות פרטיים, או כשיש רעש-רקע. ב-2025 החלה OpenAI להציע מודלי-תמלול חדשים מבוססי-GPT-4o, שהראו שיעורי-שגיאה נמוכים יותר מ-Whisper במבחנים פנימיים — סימן לכך שהתחום ממשיך להשתפר במהירות, ולא הגיע לרמת-רוויה.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות