דיבור-לטקסט (Speech-to-Text)
תמונה, קול ווידאו
דיבור-לטקסט (Speech-to-Text, STT) היא טכנולוגיה שהופכת דיבור מוקלט לטקסט כתוב — הכיוון ההפוך מטקסט-לדיבור, והבסיס לתמלול אוטומטי ולכל שיחה קולית עם AI.
כשמדברים בקול אל עוזר AI, הצעד הראשון תמיד הוא STT: הקול מומר לטקסט, ורק אז המודל "מבין" ומעבד את הבקשה כאילו הוקלדה. איכות ה-STT — כולל התמודדות עם רעש רקע, מבטאים, ומספר דוברים — משפיעה ישירות על איכות כל השיחה שאחריה.
מודלי STT מודרניים תומכים ביותר ויותר שפות ומבטאים באיכות גבוהה, אבל שפות עם פחות חומר אימון זמין (כולל עברית, יחסית לאנגלית) עדיין נוטות להציג יותר טעויות תמלול, במיוחד במונחים מקצועיים או שמות פרטיים.