יצירת וידאו עם קול מסונכרן (Video Generation with Synchronized Audio)

תמונה, קול ווידאו

הגדרה

יצירת וידאו עם קול מסונכרן היא הפקה של קטע וידאו ושל הפסקול שלו — דיבור, אפקטים ורעשי רקע — באותו תהליך יצירה, כך שהצליל אינו מודבק לתמונה בדיעבד.

מה משתנה כשהקול נוצר יחד עם התמונה

בגרסאות המוקדמות של מחוללי וידאו כמו Veo נוצר קטע אילם, ומי שרצה פסקול הוסיף אותו בשלב נפרד: מוזיקה מספרייה, קריינות מהקראה ממוחשבת או הקלטה אמיתית. יצירת וידאו עם קול מסונכרן מאחדת את שני השלבים — המודל מקבל תיאור אחד ומחזיר קטע שבו הצליל כבר קשור למה שקורה על המסך. כשגוגל הציגה את Veo 3 ב-20 במאי 2025, היא תיארה אותו כגרסה הראשונה במשפחת Veo שמייצרת וידאו עם שמע: רעשי תנועה ברקע של רחוב עירוני, ציוץ ציפורים בפארק ואפילו דיאלוג בין דמויות, כולל סנכרון שפתיים. ההבדל המעשי הוא שהיוצר מתאר בהנחיה גם את הצליל — צעדים, מוזיקת רקע, משפט שדמות אומרת — ולא רק את התמונה.

שתי דרכים לחבר קול לתמונה

הדרך הראשונה היא בשני שלבים: קודם נוצר וידאו, ואחר כך מודל נפרד "צופה" בו ומייצר צליל מתאים. כך בנויה מערכת המחקר Movie Gen של Meta — מודל שמע בגודל 13 מיליארד פרמטרים שמקבל וידאו והנחיית טקסט אופציונלית, ומפיק עד 45 שניות של צלילי סביבה, אפקטים (Foley) ומוזיקת רקע כלית, מסונכרנים לתוכן הווידאו. דיבור אינו נמנה עם מה ש-Meta מתארת שהמודל הזה מפיק. הדרך השנייה היא יצירה משותפת. בדוח הטכני של Veo 3 מתארת Google DeepMind מודל דיפוזיה סמויה (latent diffusion) שבו תהליך הדיפוזיה מופעל במשותף על ייצוג דחוס של השמע לאורך זמן ועל ייצוג דחוס של הווידאו במרחב ובזמן; כל אחד מהם מקודד תחילה בנפרד. במילים פשוטות, הקול והתמונה "מתגבשים" מתוך הרעש באותו תהליך, ולא אחד אחרי השני.

דיבור וסנכרון שפתיים

החלק התובעני ביותר הוא דיבור: לא די שיישמע קול, הוא צריך להתאים לתנועת השפתיים ולדמות שאומרת אותו. זה שונה מסנכרון שפתיים (Lip Sync) במובנו הרגיל, שבו מתאימים את הפה בסרטון קיים לפסקול נתון; כאן גם התמונה וגם הקול נוצרים מאפס. OpenAI תיארה את Sora 2 כמערכת כללית ליצירת וידאו ושמע, שמסוגלת להפיק נופי צליל ברקע, דיבור ואפקטים. באפליקציה שנבנתה סביבה הוצגה תכונה בשם "characters": המשתמש מקליט פעם אחת קטע קצר של וידאו ושמע, כדי לאמת את זהותו וללכוד את מראהו וקולו, ואז אפשר לשבץ אותו בסצנות. לפי הודעת OpenAI, מוצר Sora אינו זמין עוד מאז 26 באפריל 2026 (ראו הערך סורה).

מה עדיין קשה

כרטיס המודל של Veo 3, שעודכן לאחרונה ב-13 בינואר 2026, מציין כמגבלה ידועה ששמירה על עקביות מלאה בסצנות מורכבות או בתנועה מורכבת נשארת אתגר. בדוח הטכני נכתב ש-Veo 3 עדיין חלש ביצירת טקסט בתוך התמונה ונוטה ל"הזיות" קטנות שמסגירות שהקטע מזויף, ושגם כשהוא מפיק דיפ-פייק מתמונה, התוצאה באיכות נמוכה מזו של כלים ייעודיים ופחות נשלטת — במיוחד בכל הנוגע לדיבור. בבדיקות הטיה מצאה החברה שהמודל נוטה לגווני עור בהירים יותר כשההנחיה אינה מציינת מוצא. אלה ממצאים שהיצרן עצמו מפרסם על המודל שלו, ולא בדיקה חיצונית.

איך משווים בין מודלים

אין עדיין מדד עצמאי אחד שמקובל על כולם למדידת קול ותמונה יחד. Google מדווחת שבדקה את Veo 3 על MovieGenBench, מאגר הנחיות ש-Meta פרסמה: 1,003 הנחיות לווידאו בלבד ו-527 הנחיות לווידאו עם שמע. בודקים אנושיים השוו זוגות של קטעים, ולפי Google העדיפו את Veo 3 בהעדפה הכוללת ובדיוק ההיענות להנחיה. זו הערכה שהיצרן ערך ופרסם בכרטיס המודל, ולכן יש לקרוא אותה כטענת יצרן ולא כמדידה בלתי תלויה. להשוואות לפי הצבעות עיוורות של משתמשים ראו הערך מירוץ יצירת-הווידאו בבינה מלאכותית.

סימון וחובות גילוי

קול מסונכרן הופך קטע מזויף למשכנע יותר, ולכן שאלת הסימון חריפה כאן במיוחד. לפי הכרזת Google, תוצרי Veo 3 מסומנים בסימן המים הבלתי נראה SynthID, ובאותה הכרזה הושק גם SynthID Detector, פורטל שבו אפשר להעלות קובץ ולבדוק אם הוא נושא את הסימן. באיחוד האירופי, סעיף 50 של ה-AI Act מחייב ספקי מערכות שמפיקות שמע, תמונה או וידאו סינתטיים לסמן את התוצר בפורמט קריא-מכונה. לפי לוח הזמנים של הנציבות האירופית, חובות השקיפות של סעיף 50 חלות מ-2 באוגוסט 2026, ולמערכות שכבר היו בשוק לפני המועד הזה נקבעה תקופת מעבר עד 2 בדצמבר 2026. בעמוד הרשמי של Google DeepMind, כפי שנבדק ב-27 בספטמבר 2026, הגרסה המוצגת היא Veo 3.1, שמתוארת כמודל ליצירת וידאו מטקסט ומתמונה וליצירת שמע ווידאו מטקסט.

שאלות נפוצות ❓

מה ההבדל בין וידאו עם קול מסונכרן לבין דיבוב?

בדיבוב מוסיפים קול לסרטון שכבר קיים, ולפעמים מתאימים אליו את תנועת השפתיים. ביצירה עם קול מסונכרן גם התמונה וגם הקול נוצרים מאפס מתוך אותה הנחיה.

האם כל מחולל וידאו שמייצר קול עושה זאת באותו אופן?

לא. יש מערכות שיוצרות קודם וידאו ואחר כך מודל נפרד מוסיף לו צליל, כמו Movie Gen של Meta, ויש מערכות שבהן הקול והתמונה נוצרים במשותף, כפי ש-Google מתארת את Veo 3.

האם המודלים האלה יודעים להפיק דיבור?

Google מציינת דיאלוג בין דמויות בין יכולות Veo 3, ו-OpenAI תיארה את Sora 2 כמפיק גם דיבור. מודל השמע של Movie Gen, לעומתם, תואר כמפיק צלילי סביבה, אפקטים ומוזיקה, בלי דיבור.

איך אפשר לדעת אם קטע כזה נוצר ב-AI?

אין בדיקה אחת ודאית. תוצרי Veo 3 מסומנים ב-SynthID ואפשר לבדוק אותם בכלי של Google, אבל סימן כזה מזהה רק תוצרים של מי שהטביע אותו. בערך בדיקת מקוריות של מדיה סינתטית מוסבר מה כל שיטה יכולה להוכיח.

האם יש חובה חוקית לסמן וידאו כזה?

באיחוד האירופי, סעיף 50 של ה-AI Act מחייב ספקים לסמן תוכן סינתטי בפורמט קריא-מכונה, והחובה חלה מ-2 באוגוסט 2026, עם תקופת מעבר עד 2 בדצמבר 2026 למערכות שכבר היו בשוק.