תמונה, קול ווידאו
בינה מלאכותית יוצרת — לא רק טקסט, אלא גם תמונות, קול ומוזיקה, ווידאו, מנקודת המבט של מי שרוצה להבין את הטכנולוגיה שמאחורי כלים כמו יצירת-תמונות מטקסט או שכפול-קול. הקטגוריה מסבירה את השיטות המרכזיות שמניעות יצירת מדיה סינתטית (כמו מודלי-דיפוזיה ליצירת תמונות), את סוגי התוכן השונים שאפשר לייצר היום, ואת המונחים הנלווים שרלוונטיים לכל מי שנתקל בתוכן שנוצר על ידי AI — כולל דרכים לזהות תוכן כזה. זו אחת הקטגוריות שבהן הפער בין "מה שהיה אפשרי לפני כמה שנים" לבין "מה שאפשרי היום" הכי בולט לעין: תמונות ווידאו שנוצרו על ידי AI כבר קשות להבחנה מתוכן אמיתי במבט ראשון, מה שהופך את ההבנה של המונחים כאן — ושל הסכנות הכרוכות בכך (כמו דיפ-פייק) — לחשובה במיוחד גם למי שלא עוסק בטכנולוגיה מקצועית. הקטגוריה מיועדת גם למי שרק צורך תוכן ורוצה להבין מה בדיוק הוא רואה, וגם למי שמעוניין ליצור בעצמו — עם דגש על ההבדל בין שימוש אחראי בכלים האלה לבין שימוש שמטרתו להטעות.
אימות מקוריות תוכן (Content Authenticity)
אימות מקוריות תוכן הוא תקן טכני (כמו C2PA) שמצרף לתמונה או וידאו "היסטוריה חתומה" — מי צילם/יצר אותו, באילו כלים נערך — כדי שצופים יוכלו לאמת את מקורו.
דיבור-לטקסט (Speech-to-Text)
דיבור-לטקסט (Speech-to-Text) היא טכנולוגיה שהופכת דיבור מוקלט לטקסט כתוב.
דיפ-פייק (Deepfake)
דיפ-פייק (Deepfake) הוא תמונה, סרטון או הקלטה מזויפים שנוצרו על ידי AI ונראים אמיתיים, למרות שהם לא.
הגדלת רזולוציה (Upscaling)
הגדלת רזולוציה היא שימוש ב-AI כדי להגדיל תמונה תוך "המצאת" פרטים חדשים ומשכנעים — שונה מהגדלה פשוטה שרק מותחת פיקסלים קיימים ומטשטשת אותם.
החלפת פנים (Face Swap)
החלפת פנים היא טכניקת AI שמחליפה את פני אדם בסרטון או תמונה בפני אדם אחר, תוך שמירה על תנועות ותאורה טבעיות — אחת הטכניקות המרכזיות שמאחוריה עומדים דיפ-פייקים.
העברת סגנון (Style Transfer)
העברת סגנון היא שימוש ב-AI כדי להחיל את הסגנון האמנותי של תמונה אחת (למשל ציור מוכר) על תוכן של תמונה אחרת — משלב תוכן ממקור אחד וסגנון ממקור שני.
הרחבת-תמונה (Outpainting)
הרחבת-תמונה היא שימוש ב-AI כדי להרחיב תמונה קיימת מעבר לגבולותיה המקוריים — יוצר תוכן חדש ומתאים-סגנונית באזורים שלא היו קיימים כלל בתמונה המקורית.
טקסט-לדיבור (Text-to-Speech)
טקסט-לדיבור (Text-to-Speech) היא טכנולוגיה שהופכת טקסט כתוב לקול מדובר טבעי.
יצירת וידאו מטקסט (Text-to-Video)
יצירת וידאו מטקסט (Text-to-Video) היא טכנולוגיה חדשה יחסית שיוצרת קטעי וידאו קצרים ישירות מתיאור מילולי.
יצירת מוזיקה (AI Music Generation)
יצירת מוזיקה בבינה מלאכותית היא הפקת קטעי-מוזיקה מקוריים (מנגינה, אקורדים, ולעיתים גם שירה) מהנחיה טקסטואלית — בדומה ליצירת-תמונה-מטקסט, אך בתחום הקול.
יצירת תלת-מימד (3D Generation)
יצירת תלת-מימד היא הפקת מודל תלת-ממדי (אובייקט או סצנה) ע"י AI מתוך תיאור טקסטואלי או תמונה — הרחבה של יצירת-תמונה למרחב תלת-ממדי מלא.
יצירת תמונה מטקסט (Text-to-Image)
יצירת תמונה מטקסט (Text-to-Image) היא טכנולוגיה שהופכת תיאור מילולי לתמונה חדשה שנוצרה מאפס.
מודל דיפוזיה (Diffusion Model)
מודל דיפוזיה (Diffusion Model) הוא הטכניקה שמאחורי רוב כלי יצירת התמונות של היום — המודל מעדן רעש אקראי בהדרגה לכדי תמונה, לפי תיאור טקסטואלי.
מילוי-פערים (Inpainting)
מילוי-פערים הוא שימוש ב-AI כדי למלא באופן משכנע חלק חסר או מסומן בתמונה — הסרת אובייקט לא-רצוי, או שחזור פינה פגומה בתמונה ישנה.
סימן מים דיגיטלי (Digital Watermarking)
סימן מים דיגיטלי הוא סימון בלתי-נראה (או גלוי) שמוטבע בתוכן שנוצר ע"י AI, כדי לאפשר לזהות בעתיד שהתוכן מקורו במודל AI ולא נוצר ע"י בן-אדם.
סנכרון שפתיים (Lip Sync)
סנכרון שפתיים הוא התאמה אוטומטית של תנועות-פה בסרטון לפסקול-קול נתון — כך שדמות "אומרת" מילים חדשות בצורה משכנעת חזותית, גם אם לא אמרה אותן בפועל.
עריכת וידאו בבינה מלאכותית (AI Video Editing)
עריכת וידאו בבינה מלאכותית היא שימוש ב-AI לביצוע משימות-עריכה שבעבר דרשו עבודה ידנית ממושכת — חיתוך אוטומטי, הסרת רעשי-רקע, יצירת כתוביות, או שינוי-רקע — בשבריר מהזמן.
רשת יריבה גנרטיבית (GAN)
רשת יריבה גנרטיבית היא ארכיטקטורה שבה שתי רשתות-נוירונים "מתחרות" זו בזו — אחת מייצרת תוכן מזויף, השנייה מנסה לזהות שהוא מזויף — תחרות שמשפרת את שתיהן עד לתוצרים משכנעים ביותר.
שיבוט קול (Voice Cloning)
שיבוט קול (Voice Cloning) הוא יצירת עותק דיגיטלי של קול אדם ספציפי מתוך דגימת הקלטה קצרה.
תמונה-לתמונה (Image-to-Image)
תמונה-לתמונה היא יכולת AI להפוך תמונת-קלט לתמונה חדשה לפי הנחיה — למשל שינוי סגנון, צביעת סקיצה, או המרת רישום-קו לתמונה ריאליסטית.