Whisper — מודל זיהוי-דיבור של OpenAI; אומן על 680,000 שעות אודיו

כלים וסוכנים

הגדרה

Whisper הוא מודל זיהוי-דיבור בקוד-פתוח של OpenAI, ששוחרר בספטמבר 2022, מתמלל ומתרגם דיבור במגוון שפות באמצעות ארכיטקטורת טרנספורמר שהחליפה דגמים מבוססי-RNN קודמים.

Whisper הוא מודל זיהוי-דיבור כללי שפיתחה OpenAI ושחררה בקוד פתוח בספטמבר 2022. הוא לא רק מתמלל דיבור לטקסט — הוא גם מתרגם דיבור משפה זרה לאנגלית, ומזהה איזו שפה נאמרת, הכול באמצעות אותו מודל יחיד. קוד המודל ומשקלותיו זמינים בחינם תחת רישיון MIT, כך שכל מפתח יכול להוריד ולהריץ אותו על המחשב שלו בלי תלות ב-API בתשלום — בשונה מרוב מוצרי-ה-AI המסחריים של OpenAI, שנגישים רק דרך שירות מקוון.

Whisper אומן על 680,000 שעות של אודיו מתויג שנאספו מהאינטרנט, מהן כ-117,000 שעות ב-96 שפות שאינן אנגלית, ו-125,000 שעות נוספות של זוגות-תרגום — היקף-נתונים גדול במיוחד שמסביר חלק מיכולתו להתמודד עם מבטאים ורעשי-רקע בלי אימון-ייעודי נוסף. המודל מגיע בכמה גדלים — מ"טיני" הקל-משקל (כ-39 מיליון פרמטרים) ועד "לארג'" (כ-1.5 מיליארד פרמטרים) — כדי לאפשר איזון בין מהירות-ריצה לדיוק, בהתאם לצורך של כל אפליקציה.

Whisper החליף בפועל מערכות זיהוי-דיבור מבוססות-RNN/LSTM קודמות שהיו נפוצות עד תחילת שנות ה-2020 (ראו רשת נשנית), הודות לארכיטקטורת הטרנספורמר שמעבדת את קטע-האודיו כולו בבת אחת במקום מילה-אחר-מילה. הוא הפך למרכיב סטנדרטי בכלים רבים של צד-שלישי — משירותי-כתוביות אוטומטיות ועד עוזרים קוליים — בזכות היותו חינמי ופתוח. עם זאת, גם OpenAI עצמה כבר לא מסתמכת עליו בלבד: במרץ 2025 היא השיקה מודלי-תמלול חדשים מבוססי-GPT-4o עם שיעורי-שגיאה נמוכים מ-Whisper, המיועדים בעיקר לשימוש בממשק-ה-API המסחרי שלה.