מהמעבדה למוצר-צריכה: איך המונח התפוצץ
עד סוף 2022 השתמשו בביטוי "מודל גנרטיבי" בעיקר חוקרים וקהילת למידת-המכונה. השקת ChatGPT בנובמבר אותה שנה שינתה את זה בבת אחת: תוך חודשים בודדים "בינה מלאכותית יוצרת" הפך למונח שגור בתקשורת הכללית, בישיבות-דירקטוריון ובשיחות רגילות, לא רק במאמרים אקדמיים. ההבדל בין שני המונחים אינו מקרי — "בינה מלאכותית יוצרת" מתאר את הרובד השימושי-והציבורי: מוצרים ושירותים בפועל שאדם רגיל יכול לפתוח בדפדפן ולהשתמש בהם, ולא רק את המנגנון המתמטי שמפעיל אותם מאחורי הקלעים.
הבסיס הטכני: מודלים גנרטיביים גדולים
כל מערכת בינה מלאכותית יוצרת בנויה על גבי מודל גנרטיבי — כלי סטטיסטי שלמד להפיק דוגמאות חדשות מתוך דפוסים שראה במאגר-אימון ענק, בניגוד למודל שרק מסווג נתונים קיימים. ההבדל בין המונחים הוא הבדל-רובד, לא הבדל-טכנולוגיה: כשמדברים על "איך זה עובד מתמטית" מדברים על מודל גנרטיבי; כשמדברים על "מה זה עושה בשבילי כמשתמש" מדברים על בינה מלאכותית יוצרת. רוב המערכות המוכרות היום נשענות במיוחד על מודלים גנרטיביים גדולים-במיוחד, שאומנו על כמויות-נתונים עצומות ביחס למה שהיה נהוג לפני 2020.
מבחר הארכיטקטורות שמאחורי הכלים המוכרים
בפועל, בינה מלאכותית יוצרת מבוססת על כמה משפחות-ארכיטקטורה שונות, כל אחת מתאימה יותר לסוג-תוכן אחר. יצירת-תמונות נשענת היום בעיקר על מודל-דיפוזיה, שמעדן רעש אקראי בהדרגה לכדי תמונה; דור קודם של כלי-תמונה נשען על רשת יריבה גנרטיבית (GAN), שבה שתי רשתות מתחרות זו בזו. יצירת-טקסט, לעומת זאת, נשענת כמעט תמיד על מודל שפה גדול מבוסס-טרנספורמר. הבחירה בין הארכיטקטורות אינה שרירותית — היא נובעת ממאפייני-סוג-התוכן שרוצים לייצר, לא ממגמת-אופנה. כל הארכיטקטורות האלה הן, יש לציין, מקרים ספציפיים של אותו מושג-על אחד — מודל גנרטיבי — שממנו הן נגזרות.
מעבר לטקסט: תמונה, קול, וידאו וקוד
התפוצצות-2022 החלה סביב יצירת-טקסט (ChatGPT) ותמונה, אך התחום התרחב מהר מאוד לכל סוגי-תוכן דיגיטלי כמעט. כלים גנרטיביים כותבים היום קוד-תוכנה שלם, מלחינים מוזיקה, מייצרים קולות-דיבור סינתטיים משכנעים, ומאז 2024 גם קטעי-וידאו קצרים באיכות גבוהה יחסית. המשותף לכל היישומים האלה הוא העיקרון הבסיסי הזהה: המודל למד דפוסים ממאגר-נתונים ענק מאותו סוג-תוכן, ומייצר ממנו דוגמאות חדשות שלא הופיעו במאגר-האימון במדויק — לא העתקה, אלא הפקה של תוכן חדש שדומה סטטיסטית למה שהמודל ראה.
מגבלות וסוגיות פתוחות
לצד ההתלהבות, לבינה מלאכותית יוצרת יש מגבלות ידועות שעדיין לא נפתרו במלואן. המערכות עלולות "להזות" — לייצר תשובות שנשמעות בטוחות אך שגויות עובדתית. עולה גם שאלת זכויות-היוצרים על נתוני-האימון שהמודלים למדו מהם, ללא הסכמה מפורשת של היוצרים המקוריים במקרים רבים, וכן סוגיית דיפ-פייק שהטכנולוגיה מקלה על יצירתו. בתעשיות רבות מתפתחת כעת רגולציית בינה מלאכותית שמנסה להדביק את הפער בין קצב-האימוץ המהיר לבין ההבנה הציבורית של הסיכונים, אך התהליך עדיין באמצע הדרך ושונה מאוד ממדינה למדינה.
גרסה פשוטה של הערך, לגיל 12. כל מה שכתוב כאן מופיע גם בערך המלא.
הרבה תוכנות עושות משהו עם מידע שכבר קיים: ממיינות תמונות, מחפשות מילה, בודקות אם תשובה נכונה. בינה מלאכותית יוצרת עושה משהו אחר: היא מייצרת דבר חדש. טקסט, תמונה, קול, מוזיקה, קוד של תוכנה, ומאז 2024 גם קטעי וידאו קצרים.
איך זה עובד? מאחורי כל כלי כזה יש מודל שלמד מתוך כמות עצומה של דוגמאות מאותו סוג: המון טקסטים, או המון תמונות. הוא מוצא בהן דפוסים, ואז מייצר דוגמה חדשה שדומה להן, ובדרך כלל לא מעתיק אף אחת מהן בדיוק. זה קצת כמו מי שקרא המון סיפורי בלשים וכותב עכשיו סיפור משלו: הוא לא מעתיק אף סיפור, אבל אפשר לזהות בו את כל הכללים של סיפורי בלשים.
לכל סוג תוכן יש שיטה משלו. ביצירת תמונות, למשל, מתחילים מכתמים אקראיים שנראים כמו רעש, ומנקים אותם צעד אחרי צעד עד שמופיעה תמונה.
המונח הפך מוכר לכולם אחרי שהושק ChatGPT בנובמבר 2022. לפני כן השתמשו בו בעיקר חוקרים. תוך חודשים ספורים דיברו עליו בחדשות ובשיחות רגילות.
חשוב לזכור שני דברים. הראשון: מה שכלי כזה כותב יכול להישמע בטוח לגמרי ועדיין להיות שגוי. לזה קוראים "הזיה". השני: הכלים האלה למדו מיצירות של אנשים אמיתיים, ובמקרים רבים בלי שהיוצרים הסכימו לכך במפורש, ועל זה עדיין מתווכחים. אז כשכלי כזה עונה לכם על שאלה, כדאי לבדוק את העובדות במקום נוסף.
מה המושג אומר לארגון ולעסק. כל עובדה כאן מופיעה גם בערך המלא.
בינה מלאכותית יוצרת היא השכבה המוצרית: כלים שמייצרים תוכן חדש (טקסט, תמונה, קול, קוד, ומאז 2024 גם וידאו קצר) ולא רק מסווגים או מנתחים נתונים קיימים. מתחת לכל כלי כזה יושב מודל גנרטיבי, שלמד דפוסים ממאגר ענק ומפיק דוגמאות חדשות שדומות להם סטטיסטית.
בארגון זה פוגש אתכם כמעט בכל מקום שבו נוצר תוכן: טיוטות טקסט, קוד, תמונות, קולות דיבור סינתטיים. חשוב להבין שאין כאן טכנולוגיה אחת. יצירת טקסט נשענת כמעט תמיד על מודל שפה גדול; יצירת תמונות נשענת היום בעיקר על מודל דיפוזיה, שמעדן רעש אקראי בהדרגה לכדי תמונה, ודור קודם של כלי תמונה נשען על רשת יריבה גנרטיבית (GAN), שבה שתי רשתות מתחרות זו בזו. הבחירה בארכיטקטורה נובעת מסוג התוכן, ולכן כלי שמצטיין בסוג תוכן אחד אינו ערובה להצלחה בסוג אחר.
הערך הוא הפקה של תוכן חדש, לא שליפה של תוכן קיים. אבל הגבולות נובעים מאותו מנגנון: מערכת שמפיקה את מה שדומה סטטיסטית למה שראתה עלולה "להזות", כלומר לייצר תשובה שנשמעת בטוחה ושגויה עובדתית. לכן תוצר שיוצא החוצה צריך בדיקה של אדם. יש גם שאלה פתוחה של זכויות יוצרים על נתוני האימון, שבמקרים רבים שימשו בלי הסכמה מפורשת של היוצרים, והטכנולוגיה מקלה על יצירת דיפ-פייק. הרגולציה עדיין מתגבשת ושונה מאוד ממדינה למדינה, כך שכדאי לעקוב אחריה בכל שוק שבו אתם פועלים, ולא להניח שהתמונה יציבה.
שאלות שכדאי לשאול ספק, צוות או יועץ:
- על איזה סוג מודל הכלי בנוי, והאם הוא מתאים לסוג התוכן שאנחנו צריכים לייצר?
- על אילו נתונים אומן המודל, ומה ידוע על מקורם ועל זכויות היוצרים בהם?
- איך נזהה הזיות לפני שתוכן יוצא ללקוח, ומי אחראי לבדיקה הזו?
- כשהכלי מפיק תוכן שדומה למה שראה באימון, איך בודקים שהתוצר שלנו אינו קרוב מדי ליצירה קיימת של מישהו אחר?
- אילו אמצעים יש לנו לזהות דיפ-פייק שמשתמש בשם, בקול או בדמות של הארגון שלנו?