מה משתנה כשהקול נוצר יחד עם התמונה
בגרסאות המוקדמות של מחוללי וידאו כמו Veo נוצר קטע אילם, ומי שרצה פסקול הוסיף אותו בשלב נפרד: מוזיקה מספרייה, קריינות מהקראה ממוחשבת או הקלטה אמיתית. יצירת וידאו עם קול מסונכרן מאחדת את שני השלבים — המודל מקבל תיאור אחד ומחזיר קטע שבו הצליל כבר קשור למה שקורה על המסך. כשגוגל הציגה את Veo 3 ב-20 במאי 2025, היא תיארה אותו כגרסה הראשונה במשפחת Veo שמייצרת וידאו עם שמע: רעשי תנועה ברקע של רחוב עירוני, ציוץ ציפורים בפארק ואפילו דיאלוג בין דמויות, כולל סנכרון שפתיים. ההבדל המעשי הוא שהיוצר מתאר בהנחיה גם את הצליל — צעדים, מוזיקת רקע, משפט שדמות אומרת — ולא רק את התמונה.
שתי דרכים לחבר קול לתמונה
הדרך הראשונה היא בשני שלבים: קודם נוצר וידאו, ואחר כך מודל נפרד "צופה" בו ומייצר צליל מתאים. כך בנויה מערכת המחקר Movie Gen של Meta — מודל שמע בגודל 13 מיליארד פרמטרים שמקבל וידאו והנחיית טקסט אופציונלית, ומפיק עד 45 שניות של צלילי סביבה, אפקטים (Foley) ומוזיקת רקע כלית, מסונכרנים לתוכן הווידאו. דיבור אינו נמנה עם מה ש-Meta מתארת שהמודל הזה מפיק. הדרך השנייה היא יצירה משותפת. בדוח הטכני של Veo 3 מתארת Google DeepMind מודל דיפוזיה סמויה (latent diffusion) שבו תהליך הדיפוזיה מופעל במשותף על ייצוג דחוס של השמע לאורך זמן ועל ייצוג דחוס של הווידאו במרחב ובזמן; כל אחד מהם מקודד תחילה בנפרד. במילים פשוטות, הקול והתמונה "מתגבשים" מתוך הרעש באותו תהליך, ולא אחד אחרי השני.
דיבור וסנכרון שפתיים
החלק התובעני ביותר הוא דיבור: לא די שיישמע קול, הוא צריך להתאים לתנועת השפתיים ולדמות שאומרת אותו. זה שונה מסנכרון שפתיים (Lip Sync) במובנו הרגיל, שבו מתאימים את הפה בסרטון קיים לפסקול נתון; כאן גם התמונה וגם הקול נוצרים מאפס. OpenAI תיארה את Sora 2 כמערכת כללית ליצירת וידאו ושמע, שמסוגלת להפיק נופי צליל ברקע, דיבור ואפקטים. באפליקציה שנבנתה סביבה הוצגה תכונה בשם "characters": המשתמש מקליט פעם אחת קטע קצר של וידאו ושמע, כדי לאמת את זהותו וללכוד את מראהו וקולו, ואז אפשר לשבץ אותו בסצנות. לפי הודעת OpenAI, מוצר Sora אינו זמין עוד מאז 26 באפריל 2026 (ראו הערך סורה).
מה עדיין קשה
כרטיס המודל של Veo 3, שעודכן לאחרונה ב-13 בינואר 2026, מציין כמגבלה ידועה ששמירה על עקביות מלאה בסצנות מורכבות או בתנועה מורכבת נשארת אתגר. בדוח הטכני נכתב ש-Veo 3 עדיין חלש ביצירת טקסט בתוך התמונה ונוטה ל"הזיות" קטנות שמסגירות שהקטע מזויף, ושגם כשהוא מפיק דיפ-פייק מתמונה, התוצאה באיכות נמוכה מזו של כלים ייעודיים ופחות נשלטת — במיוחד בכל הנוגע לדיבור. בבדיקות הטיה מצאה החברה שהמודל נוטה לגווני עור בהירים יותר כשההנחיה אינה מציינת מוצא. אלה ממצאים שהיצרן עצמו מפרסם על המודל שלו, ולא בדיקה חיצונית.
איך משווים בין מודלים
אין עדיין מדד עצמאי אחד שמקובל על כולם למדידת קול ותמונה יחד. Google מדווחת שבדקה את Veo 3 על MovieGenBench, מאגר הנחיות ש-Meta פרסמה: 1,003 הנחיות לווידאו בלבד ו-527 הנחיות לווידאו עם שמע. בודקים אנושיים השוו זוגות של קטעים, ולפי Google העדיפו את Veo 3 בהעדפה הכוללת ובדיוק ההיענות להנחיה. זו הערכה שהיצרן ערך ופרסם בכרטיס המודל, ולכן יש לקרוא אותה כטענת יצרן ולא כמדידה בלתי תלויה. להשוואות לפי הצבעות עיוורות של משתמשים ראו הערך מירוץ יצירת-הווידאו בבינה מלאכותית.
סימון וחובות גילוי
קול מסונכרן הופך קטע מזויף למשכנע יותר, ולכן שאלת הסימון חריפה כאן במיוחד. לפי הכרזת Google, תוצרי Veo 3 מסומנים בסימן המים הבלתי נראה SynthID, ובאותה הכרזה הושק גם SynthID Detector, פורטל שבו אפשר להעלות קובץ ולבדוק אם הוא נושא את הסימן. באיחוד האירופי, סעיף 50 של ה-AI Act מחייב ספקי מערכות שמפיקות שמע, תמונה או וידאו סינתטיים לסמן את התוצר בפורמט קריא-מכונה. לפי לוח הזמנים של הנציבות האירופית, חובות השקיפות של סעיף 50 חלות מ-2 באוגוסט 2026, ולמערכות שכבר היו בשוק לפני המועד הזה נקבעה תקופת מעבר עד 2 בדצמבר 2026. בעמוד הרשמי של Google DeepMind, כפי שנבדק ב-27 בספטמבר 2026, הגרסה המוצגת היא Veo 3.1, שמתוארת כמודל ליצירת וידאו מטקסט ומתמונה וליצירת שמע ווידאו מטקסט.