D-ID — אנימציית-דיבור ישראלית שהחלה כהגנה נגד זיהוי-פנים
הגדרה
D-ID היא חברה ישראלית שנוסדה ב-2017, שהטכנולוגיה שלה מנפישה תמונת-סטילס לדמות מדברת עם סנכרון-שפתיים; החלה דווקא בהגנה מפני זיהוי-פנים.
השם הוא ראשי תיבות של de-identification, וזה לא מקרי
D-ID נוסדה בשנת 2017 על ידי גיל פרי, סלע בלונדהיים ואלירן קוטה, והתחילה בכיוון ההפוך בדיוק מזה שהיא מזוהה איתו היום. המוצר הראשון שלה נועד להגן על אנשים מפני זיהוי פנים אוטומטי: הוא הכניס לתמונה שינויים זעירים שעין אנושית אינה מבחינה בהם כלל, אך שגרמו למערכות זיהוי פנים לא להצליח לשייך את התמונה לאדם שבה. הרעיון נולד מצורך אישי של המייסדים, ששירתו בתפקידים רגישים ולא יכלו לפרסם תמונות שלהם ברשת גם אחרי שהשתחררו. בשנת 2017, כשמערכות זיהוי פנים החלו להיות זמינות מסחרית בקנה מידה רחב, זו הייתה בעיה אמיתית וחדשה — והפתרון היה טכנית מרשים, כי הוא דרש להבין את מבנה הפנים ברמת דיוק גבוהה מספיק כדי לשבש דווקא את הרכיבים שהמערכות מסתמכות עליהם, ולא את המראה הכללי. שווה לשים לב לאירוניה שנשמרת לאורך כל הסיפור: אותה חברה שנולדה כדי להפוך פנים לבלתי ניתנות לזיהוי היא זו שלימדה מחשבים להנפיש פנים בצורה משכנעת.
מהגנה ליצירה: אותו מודל, כיוון הפוך
המסלול מהגנה על פנים ליצירת פנים נראה כמו סתירה, ולמעשה הוא תוצאה טבעית. שתי המשימות דורשות בדיוק את אותו דבר: מודל שמבין איך פנים אנושיות בנויות ואיך הן משתנות. אם אתה יודע לשנות תווי פנים בצורה מבוקרת כדי שמחשב לא יזהה אותם, אתה גם יודע לשנות אותם בצורה מבוקרת כדי שייראו כאילו הם זזים, מדברים או מחייכים. ההבדל היחיד הוא הכיוון שאליו מפעילים את היכולת. כך התגלגלה החברה למוצר אחר לגמרי — הנפשה של תמונת סטילס לדמות מדברת, עם תנועות ראש, מצמוצים וסנכרון שפתיים לקול. זהו דפוס שחוזר בתחום כולו: כלים שנבנו לזיהוי ולהגנה וכלים שנבנים ליצירה הם לעיתים קרובות אותה טכנולוגיה בדיוק, ורק השאלה מה עושים איתה מפרידה ביניהם. זו נקודה שכדאי לחזור אליה בכל דיון על רגולציה של הטכנולוגיה הזו: אי אפשר לאסור על היכולת עצמה בלי לפגוע גם בשימושים שאיש אינו חולק עליהם, כמו הנגשה, תרגום ושחזור היסטורי. הוויכוח האמיתי הוא על השימוש, על ההסכמה ועל הסימון — לא על עצם קיומו של המודל.
פברואר 2021: Deep Nostalgia
הרגע שהכניס את הטכנולוגיה לתודעה העולמית הגיע בפברואר 2021, כשחברת MyHeritage הישראלית השיקה על גביה את השירות Deep Nostalgia — הנפשה של תצלומים ישנים של קרובים שנפטרו. אדם מעלה תמונה של סבתא שלו משנות החמישים, וכעבור שניות רואה אותה מסובבת את הראש, ממצמצת ומחייכת אליו. השירות הפך לתופעה ויראלית תוך ימים, סוכנות רויטרס תיארה אותו ככלי מצמרר, ולפי החברה יצר לבדו כמאה מיליון הנפשות עד מרץ 2022. חשוב להבחין בין שתי החברות כאן, כי הבלבול נפוץ: את השירות הפעילה MyHeritage מול הציבור, והטכנולוגיה שמאחוריו הייתה של D-ID. הגרסה של אותה תקופה גם לא גרמה לדמות לדבר, אלא רק הזיזה את פניה — הבחנה שדווקא היא הפכה מרכזית בדיון שהתפתח בהמשך. המספר הזה ממחיש גם משהו על קצב האימוץ של כלים כאלה: מה שדרש עד אז אולפן, תקציב ואנשי מקצוע הפך למשהו שאדם עושה בטלפון שלו בזמן שהוא יושב בסלון, בלי לדעת דבר על הטכנולוגיה שמאחוריו. Deep Nostalgia הוא המקרה הישראלי הבולט בתופעה רחבה יותר, שיש לה כיום ספקים ומחירונים בכמה מדינות ומתוארת בערך החייאה דיגיטלית של נפטרים.
הדיון הציבורי שזה פתח
Deep Nostalgia היה רגע מפתח פחות בגלל הטכנולוגיה ויותר בגלל מי שהשתמש בה. עד אז הדיון על מניפולציית וידאו התנהל סביב פוליטיקאים, ידוענים והונאות, כלומר סביב תרחישי נזק. כאן, לראשונה, מיליוני אנשים רגילים הפעילו טכנולוגיה כזו על המשפחה שלהם עצמם, מרצונם החופשי ומתוך רגש — ופתאום השאלה מה מותר לעשות בדמותם של המתים הפסיקה להיות שאלה תיאורטית. התגובות היו חצויות באופן מובהק ולא נחלקו לפי ידע טכנולוגי: היו מי שתיארו את החוויה כמרגשת ומנחמת, והיו מי שתיארו אותה כהפרה של משהו — של זיכרון, של כבוד למת, של הגבול בין תצלום לבין המצאה. שני הצדדים צדקו במובן מסוים, וזו בדיוק הסיבה שהדיון הזה נמשך עד היום ולא הוכרע. מה שהפך את הרגע הזה למשמעותי הוא שהוא לא נשאר תיאורטי. מיליוני אנשים קיבלו החלטה קטנה ואישית — להעלות תמונה של קרוב שנפטר ולראות אותו זז — וכל אחת מההחלטות האלה היא בעצם עמדה בשאלה שמומחים התווכחו עליה שנים בלי הכרעה.
המעבר לשוק העסקי
אחרי גל התהודה פנתה החברה לשוק שבו הכסף נמצא: אווטארים מדברים לשימוש עסקי, שאפשר לייצר מתמונה אחת ומטקסט כתוב — לשירות לקוחות, להדרכת עובדים ולשיווק. במרץ 2022 גייסה 25 מיליון דולר בסבב B בהובלת Macquarie Capital, וסך הגיוס שלה הגיע אז ל-48 מיליון דולר. בין הלקוחות שדווחו באותה עת היו MyHeritage, אולפני Warner Bros., תאגיד המזון Mondelez וסוכנויות פרסום. ההיגיון העסקי כאן פשוט: הפקת סרטון הדרכה עם שחקן, צלם ואולפן עולה אלפי דולרים ולוקחת שבועות, ואילו אווטאר שמדבר טקסט שהוקלד עולה מעט ומתעדכן בדקות. המחיר, כמובן, הוא שהצופה יודע — או לא יודע — שהוא מדבר עם דמות שאינה קיימת, וזו בדיוק הנקודה שבה שאלת הסימון והשקיפות נעשית מעשית ולא פילוסופית. שווה לציין גם מה זה עושה לתעשיית ההפקה עצמה. כשעלות הפקת סרטון יורדת בסדר גודל, לא רק שנעשים יותר סרטונים — נעשים סרטונים שלא היו מופקים כלל, כמו הדרכה קצרה לתהליך פנימי בחברה. זו התרחבות של השוק, ולצידה לחץ ברור על מי שמתפרנס מהפקה מסורתית.
עמק המוזרות, וקו השבר של הזיופים העמוקים
מבחינה טכנית, הקושי המרכזי בהנפשת דיוקן אינו תנועת השפתיים אלא כל השאר. אדם מדבר גם בעיניים, בגבות, בתנועות ראש קטנות ובקצב נשימה, וכשהפרטים האלה חסרים או לא מתואמים זה עם זה, התוצאה נופלת אל מה שמכונה עמק המוזרות: היא דומה מספיק לאדם כדי שהמוח יצפה לאדם, ושונה מספיק כדי שירגיש שמשהו לא בסדר. חלק ניכר מההתקדמות בתחום מאז 2021 נוגע דווקא לפרטים האלה ולסנכרון ביניהם לבין הקול. מבחינה ציבורית, הטכנולוגיה יושבת ישירות על קו השבר של הזיופים העמוקים: אותה יכולת שמייצרת מנחה וירטואלי לגיטימי לסרטון הדרכה יכולה לייצר סרטון של אדם אמיתי אומר דברים שמעולם לא אמר. החברה מפרסמת מגבלות שימוש ומנגנוני אימות, אבל הגבול בין השימוש המסחרי לפוגעני נותר סוגיה פתוחה בכל התחום, ולא רק אצלה. נכון להיום אין תשובה טכנית מלאה לבעיה. סימון מים דיגיטלי, אימות מקור וכלי זיהוי אוטומטיים כולם קיימים וכולם חלקיים, והדיון בתחום עבר בשנים האחרונות מהשאלה איך מזהים זיוף לשאלה איך מוכיחים מקוריות.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
שאלות נפוצות ❓
למה חברה שהגנה מפני זיהוי פנים מייצרת היום דמויות מדברות?
כי זו אותה יכולת בשני כיוונים. גם שיבוש זיהוי פנים וגם הנפשת דיוקן דורשים מודל שמבין במדויק איך פנים בנויות ואיך הן משתנות — ורק השימוש שונה.
Deep Nostalgia זה של D-ID או של MyHeritage?
של שתיהן. את השירות הפעילה MyHeritage מול הציבור בפברואר 2021, והטכנולוגיה שהנפישה את התמונות הייתה של D-ID.
זה בעצם deepfake?
זו אותה משפחה טכנולוגית, בשימוש גלוי ומוצהר. ההבדל אינו בטכנולוגיה אלא בהסכמה ובשקיפות: אווטאר שיווקי מוצג ככזה, בעוד זיוף עמוק מתחזה לתיעוד אמיתי.
למה כל כך קשה להנפיש תמונה של פנים?
כי אדם מדבר לא רק בפה. בלי מצמוצים, תנועות גבות ותנועות ראש קטנות ומתואמות, התוצאה נופלת אל עמק המוזרות — דומה מספיק לאדם כדי שנצפה לאדם, ושונה מספיק כדי להטריד.