תמונה, קול ווידאו
בינה מלאכותית יוצרת — לא רק טקסט, אלא גם תמונות, קול ומוזיקה, ווידאו, מנקודת המבט של מי שרוצה להבין את הטכנולוגיה שמאחורי כלים כמו יצירת-תמונות מטקסט או שכפול-קול.
מה תמצאו כאן תשובה עליו
איך מכונה מייצרת תמונה של משהו שמעולם לא צולם באמת?
איך אפשר לדעת אם התמונה או הסרטון שאני רואה נוצרו במחשב?
האם מישהו יכול לזייף את הקול שלי מתוך הקלטה קצרה, ומה עושים עם זה?
יש לי תמונה ישנה או פגומה — מה כלים כאלה באמת יודעים לתקן בה, ומה הם למעשה ממציאים?
למה וידאו שנוצר במחשב עדיין נראה מוזר לפעמים, ומה נשאר קשה למכונה?
מאיפה מתחילים
- יצירת תמונה מטקסט (Text-to-Image)יצירת תמונה מטקסט (Text-to-Image) היא טכנולוגיה שהופכת תיאור מילולי לתמונה חדשה שנוצרה מאפס.
- מודל דיפוזיה (Diffusion Model) אם תקראו רק אחדמודל דיפוזיה (Diffusion Model) הוא הטכניקה שמאחורי רוב כלי יצירת התמונות של היום — המודל מעדן רעש אקראי בהדרגה לכדי תמונה, לפי תיאור טקסטואלי.
- דיפ-פייק (Deepfake)דיפ-פייק (Deepfake) הוא תמונה, סרטון או הקלטה מזויפים שנוצרו על ידי AI ונראים אמיתיים, למרות שהם לא.
עוד על הקטגוריה הזו
הקטגוריה מסבירה את השיטות המרכזיות שמניעות יצירת מדיה סינתטית (כמו מודלי-דיפוזיה ליצירת תמונות), את סוגי התוכן השונים שאפשר לייצר היום, ואת המונחים הנלווים שרלוונטיים לכל מי שנתקל בתוכן שנוצר על ידי AI — כולל דרכים לזהות תוכן כזה. זו אחת הקטגוריות שבהן הפער בין "מה שהיה אפשרי לפני כמה שנים" לבין "מה שאפשרי היום" הכי בולט לעין: תמונות ווידאו שנוצרו על ידי AI כבר קשות להבחנה מתוכן אמיתי במבט ראשון, מה שהופך את ההבנה של המונחים כאן — ושל הסכנות הכרוכות בכך (כמו דיפ-פייק) — לחשובה במיוחד גם למי שלא עוסק בטכנולוגיה מקצועית. הקטגוריה מיועדת גם למי שרק צורך תוכן ורוצה להבין מה בדיוק הוא רואה, וגם למי שמעוניין ליצור בעצמו — עם דגש על ההבדל בין שימוש אחראי בכלים האלה לבין שימוש שמטרתו להטעות.
מה לא נמצא כאן
כאן נמצאות היצירה והעריכה עצמן — השיטות שמייצרות תמונה, קול, מוזיקה, וידאו ותלת-מימד, וגם הדרכים לזהות תוכן כזה ולסמן אותו. יצירת טקסט שייכת למודלים ושפה, והנזק החברתי של תוכן מזויף נדון בבטיחות ואתיקה. סרט או ספר שמדמיינים בינה מלאכותית שייכים ל-AI בתרבות הפופולרית, ואילו טכניקת הפקה שמשתמשת בה בפועל נשארת כאן.
א
ה
י
ל
- לכידת תנועה ללא סמנים⭐ מורחב
מ
- מודל דיפוזיה (Diffusion Model)⭐ מורחב
- מילוי-פערים (Inpainting)⭐ מורחב
- מיצוי מסכה (Image Matting)⭐ מורחב
ס
פ
- פריסת גאוס תלת־ממדית⭐ מורחב
ר
- רשת יריבה גנרטיבית (GAN)⭐ מורחב
אנגלית / ראשי-תיבות
- Adobe Fireflyמשפחת-מודלים של אדובי; שיפוי משפטי למנויי Premium ומעלה
- C2PAתקן לאימות-מקור-תוכן; Leica M11-P הראשונה שמטביעה אותו
- Civitai⭐ מורחבאתר הקהילה לשיתוף מודלי תמונה ווידאו
- ControlNet⭐ מורחבארכיטקטורת התניה מרחבית למודלי דיפוזיה של תמונה
- DALL-Eמודל ליצירת-תמונה; שמו מצרף את WALL-E והצייר דאלי
- DLSSשדרוג-רזולוציה מבוסס-AI של NVIDIA; גרסה 3 גם ממציאה פריימים
- DreamBooth (התאמה אישית של מודל תמונה)⭐ מורחב
- FLUX⭐ מורחבמשפחת מודלי התמונה של Black Forest Labs
- Google Flow⭐ מורחבכלי הקולנוע-ב-AI של גוגל
- Google Imagen⭐ מורחבמודל יצירת התמונות מטקסט של גוגל
- GPT Image⭐ מורחבמחולל התמונות של OpenAI בתוך ChatGPT
- Ideogram⭐ מורחבמחולל תמונות שיודע לכתוב טקסט קריא
- Kling AI⭐ מורחבמחולל הווידאו של Kuaishou הסינית
- LTX Studio⭐ מורחבפלטפורמת וידאו-AI של לייטריקס
- Nano Banana⭐ מורחבמשפחת מודלי התמונה של Gemini
- pix2pixמודל להמרת-תמונה; צובע שחור-לבן והופך מפה לתמונת-לוויין
- Recraft⭐ מורחבכלי עיצוב שמייצר גם גרפיקה וקטורית
- Stable Diffusion⭐ מורחבמודל-דיפוזיה שרץ על כרטיס-מסך ביתי, בזכות מרחב דחוס
- StyleGANארכיטקטורת GAN של NVIDIA; מאחורי This Person Does Not Exist
- SynthIDכלי-סימון של Google; שורד פילטרים ודחיסה, מטביע ומזהה
- Udioכלי ליצירת-מוזיקה; בו נוצר BBL Drizzy, התפשר עם יוניברסל
- Veoמודל וידאו-מטקסט של Google; קליפים של 8 שניות, סימון אוטומטי
- Wan⭐ מורחבמשפחת מודלי הווידאו של Alibaba
📋 קריטריונים לבחירת הערכים בקטגוריה זו
נכנס לכאן מונח שעוסק ביצירה או בעריכה של תמונה, קול, מוזיקה, וידאו ותלת-מימד — גם השיטות עצמן, גם סוגי התוכן שהן מייצרות, וגם הדרכים לזהות תוכן כזה ולסמן אותו. הסף: טכניקה או סוג-תוכן בעל שם מוכר שקורא ייתקל בו בפועל. יצירת טקסט שייכת למודלים ושפה; הדיון בנזק החברתי של תוכן מזויף שייך לבטיחות ואתיקה; ארגון בשם מסוים — כמו Midjourney או LAION — שייך לחברות AI גלובליות, ואילו מודל או כלי בשם — Stable Diffusion, DALL·E, Sora — נכנס לכאן כשהערך עוסק בטכניקה ובתוצר ולא בישות העסקית שמאחוריהם. מודל דיפוזיה ו-GAN הם ארכיטקטורות שיכלו לשבת ביסודות, והובאו לכאן מפני שבפועל הן משמשות כמעט רק ליצירת מדיה.