מה הופך שיחה קולית ל"חיה"
עוזר קולי ותיק עובד בתורות נוקשים: לוחצים, מדברים, מחכים לתשובה. סוכן קול בזמן אמת מנסה להתנהג כמו בן שיחה: הוא מקשיב ברציפות, מחליט בעצמו מתי האדם סיים את דבריו, עונה בקול, ואם האדם מתחיל לדבר באמצע התשובה — עוצר ומקשיב. מאחורי זה עומדות כמה החלטות הנדסיות נפרדות: איך הדיבור הופך להבנה, איך מזהים את סוף התור, מה עושים בשקט, וכמה זמן מותר לחכות לפני שעונים. הערך הזה עוסק במנגנון עצמו; התחרות בין החברות שמספקות את התשתית מתוארת בערך גל סוכני הקול בזמן אמת.
שרשרת רכיבים מול מודל קול אחד
בתיעוד של OpenAI לבניית סוכני קול, כפי שנבדק ב-27 בספטמבר 2026, מוצגות שלוש ארכיטקטורות. הראשונה היא שרשרת (chained pipeline) של שלושה שלבים: המרת דיבור לטקסט, הסוכן עצמו, והמרת טקסט לדיבור. היתרון שלה הוא שאפשר לראות ולשנות את הטקסט שבין השלבים ולהחליף כל רכיב בנפרד — למשל לשמור תמליל ולהריץ בדיקת מדיניות לפני שהסוכן עונה. השנייה היא מודל דיבור-לדיבור (speech-to-speech) אחד, שמפרש את השמע, מחליט מה לעשות ועונה בקול באותו מושב. השלישית, GPT-Live, מתוארת כ"דו-כיוונית מלאה" (full duplex): היא יכולה להקשיב ולדבר בו-זמנית, ומעבירה את החשיבה ואת השימוש בכלים למערכת נפרדת, כך שהמשתמש יכול להמשיך לדבר בזמן שהעבודה ברקע נמשכת.
מי מדבר עכשיו: זיהוי תור וקטיעה
הרכיב שמכריע אם השיחה מרגישה טבעית הוא זיהוי פעילות קולית (VAD). ב-Realtime API של OpenAI יש שני מצבים. במצב ברירת המחדל התור נחתך לפי פרקי שקט, ואפשר לכוונן סף הפעלה — סף גבוה דורש קול חזק יותר ועשוי לעבוד טוב יותר בסביבה רועשת — ואת משך השקט שנחשב לסוף דיבור: ערך קצר מזהה את סוף התור מהר יותר. במצב "סמנטי" מסווג מעריך מתוך המילים עצמן את הסבירות שהמשתמש סיים; דיבור שנגמר בהיסוס יקבל המתנה ארוכה יותר ממשפט החלטי, ולפי התיעוד הסוכן נוטה פחות לקטוע את המשתמש. בפלטפורמת הסוכנים של ElevenLabs מוגדר גם כמה זמן לחכות בשקט לפני שהסוכן לוקח את התור, בין שנייה ל-30 שניות, והתיעוד מזהיר שהמתנה קצרה יוצרת שיחה מהירה יותר אך עלולה לקטוע אנשים שצריכים עוד זמן.
השהיה, ומה עושים בזמן ההמתנה
שקט ארוך אחרי שאלה מורגש מיד. ב-ElevenLabs קיימת אפשרות בשם "soft timeout": אם מודל השפה מתעכב, הסוכן אומר ביטוי מילוי קצר כמו "המ..." במקום לשתוק. ברירת המחדל היא שהאפשרות כבויה, הטווח הוא בין חצי שנייה ל-8 שניות, והחברה ממליצה להתחיל מ-3 שניות. OpenAI ממליצה למדוד כמה זמן המתקשר מחכה לתשובה מדוברת מועילה, למדוד בנפרד את זמן המערכת האחורית, ולהשוות את החציון ואת האחוזון ה-95 בין שיחות דומות. גם בחירת מנוע הקול היא פשרה: ElevenLabs מציגה את Eleven v3 כמודל האקספרסיבי שלה, המיועד לסיפור, משחקים והפקת מדיה ביותר מ-70 שפות, ואת Flash v2.5 כמודל בהשהיה נמוכה ב-32 שפות, למקרים שבהם המהירות חשובה.
איך בודקים סוכן קול
לפי המדריך של OpenAI, בודקים גם את השיחה וגם את התוצאה: בסוכן שקובע תורים, למשל, מקשיבים לאישור ובודקים שהתור אכן נשמר. את זיהוי הדיבור יש לבדוק מול מבטאים שונים, רעשי רקע, מעבר בין שפות, שמות ומספרים, ואת מהירות התגובה יש לבחון לצד שקט לא רצוי, דיבור חופף והיענות לקטיעות. המדריך מציע להתקדם בשלבים: תחילה קול סינתטי ובקשות בודדות שאפשר לחזור עליהן, אחר כך הקלטות של בני אדם אמיתיים, ולבסוף "מתקשר" מדומה שמנהל שיחה של כמה תורות, משנה דרישות וקוטע. לצד הציונים האוטומטיים מומלצת האזנה אנושית כדי להעריך הגייה, טבעיות וקצב.
קול משוכפל, הסכמה וגילוי
סוכן קול יכול לדבר בקול מוכן מראש או בקול ששוכפל מאדם אמיתי, והמקרה השני מעורר שאלות של הסכמה. במרץ 2024 תיארה OpenAI את Voice Engine, מודל שמייצר דיבור הדומה לדובר המקורי מתוך דגימת שמע אחת של 15 שניות, והודיעה שבשלב זה לא תפיץ אותו לציבור הרחב. השותפים שבחנו אותו נדרשו להסכמה מפורשת ומדעת של הדובר המקורי ולגילוי ברור לקהל שהקולות נוצרו ב-AI. ElevenLabs מציינת בעמוד המוצר שלה שנדרשת הרשאה לשכפול כל קול. גם הדין מתחיל להתייחס לכך: ב-8 בפברואר 2024 קבעה ועדת התקשורת הפדרלית האמריקאית (FCC) שקולות שנוצרו ב-AI בשיחות טלפון הם "מלאכותיים" לפי חוק הגנת צרכן הטלפון (TCPA), ולכן חלות עליהם אותן מגבלות, ובהן דרישת הסכמה מוקדמת בכתב לשיחות שיווק אוטומטיות. באיחוד האירופי, סעיף 50 של ה-AI Act מחייב לתכנן מערכת שמשוחחת ישירות עם בני אדם כך שיידעו שהם מדברים עם AI, אלא אם הדבר ברור מההקשר; לפי הנציבות האירופית, סעיף 50 חל מ-2 באוגוסט 2026.