בינה מלאכותית יוצרת (Generative AI)

יסודות בינה מלאכותית

🆕 את הערך הזה אפשר לקרוא גם בגרסה לגיל 12 או בגרסה למנהלים.

הגדרה

בינה מלאכותית יוצרת היא הכינוי הרווח, מאז 2022 בערך, למערכות AI שמייצרות טקסט, תמונה, קול או קוד חדשים ומקוריים לשימוש מעשי, ולא רק מסווגות או מנתחות נתונים קיימים.

רמת הסבר:

מהמעבדה למוצר-צריכה: איך המונח התפוצץ

עד סוף 2022 השתמשו בביטוי "מודל גנרטיבי" בעיקר חוקרים וקהילת למידת-המכונה. השקת ChatGPT בנובמבר אותה שנה שינתה את זה בבת אחת: תוך חודשים בודדים "בינה מלאכותית יוצרת" הפך למונח שגור בתקשורת הכללית, בישיבות-דירקטוריון ובשיחות רגילות, לא רק במאמרים אקדמיים. ההבדל בין שני המונחים אינו מקרי — "בינה מלאכותית יוצרת" מתאר את הרובד השימושי-והציבורי: מוצרים ושירותים בפועל שאדם רגיל יכול לפתוח בדפדפן ולהשתמש בהם, ולא רק את המנגנון המתמטי שמפעיל אותם מאחורי הקלעים.

הבסיס הטכני: מודלים גנרטיביים גדולים

כל מערכת בינה מלאכותית יוצרת בנויה על גבי מודל גנרטיבי — כלי סטטיסטי שלמד להפיק דוגמאות חדשות מתוך דפוסים שראה במאגר-אימון ענק, בניגוד למודל שרק מסווג נתונים קיימים. ההבדל בין המונחים הוא הבדל-רובד, לא הבדל-טכנולוגיה: כשמדברים על "איך זה עובד מתמטית" מדברים על מודל גנרטיבי; כשמדברים על "מה זה עושה בשבילי כמשתמש" מדברים על בינה מלאכותית יוצרת. רוב המערכות המוכרות היום נשענות במיוחד על מודלים גנרטיביים גדולים-במיוחד, שאומנו על כמויות-נתונים עצומות ביחס למה שהיה נהוג לפני 2020.

מבחר הארכיטקטורות שמאחורי הכלים המוכרים

בפועל, בינה מלאכותית יוצרת מבוססת על כמה משפחות-ארכיטקטורה שונות, כל אחת מתאימה יותר לסוג-תוכן אחר. יצירת-תמונות נשענת היום בעיקר על מודל-דיפוזיה, שמעדן רעש אקראי בהדרגה לכדי תמונה; דור קודם של כלי-תמונה נשען על רשת יריבה גנרטיבית (GAN), שבה שתי רשתות מתחרות זו בזו. יצירת-טקסט, לעומת זאת, נשענת כמעט תמיד על מודל שפה גדול מבוסס-טרנספורמר. הבחירה בין הארכיטקטורות אינה שרירותית — היא נובעת ממאפייני-סוג-התוכן שרוצים לייצר, לא ממגמת-אופנה. כל הארכיטקטורות האלה הן, יש לציין, מקרים ספציפיים של אותו מושג-על אחד — מודל גנרטיבי — שממנו הן נגזרות.

מעבר לטקסט: תמונה, קול, וידאו וקוד

התפוצצות-2022 החלה סביב יצירת-טקסט (ChatGPT) ותמונה, אך התחום התרחב מהר מאוד לכל סוגי-תוכן דיגיטלי כמעט. כלים גנרטיביים כותבים היום קוד-תוכנה שלם, מלחינים מוזיקה, מייצרים קולות-דיבור סינתטיים משכנעים, ומאז 2024 גם קטעי-וידאו קצרים באיכות גבוהה יחסית. המשותף לכל היישומים האלה הוא העיקרון הבסיסי הזהה: המודל למד דפוסים ממאגר-נתונים ענק מאותו סוג-תוכן, ומייצר ממנו דוגמאות חדשות שלא הופיעו במאגר-האימון במדויק — לא העתקה, אלא הפקה של תוכן חדש שדומה סטטיסטית למה שהמודל ראה.

מגבלות וסוגיות פתוחות

לצד ההתלהבות, לבינה מלאכותית יוצרת יש מגבלות ידועות שעדיין לא נפתרו במלואן. המערכות עלולות "להזות" — לייצר תשובות שנשמעות בטוחות אך שגויות עובדתית. עולה גם שאלת זכויות-היוצרים על נתוני-האימון שהמודלים למדו מהם, ללא הסכמה מפורשת של היוצרים המקוריים במקרים רבים, וכן סוגיית דיפ-פייק שהטכנולוגיה מקלה על יצירתו. בתעשיות רבות מתפתחת כעת רגולציית בינה מלאכותית שמנסה להדביק את הפער בין קצב-האימוץ המהיר לבין ההבנה הציבורית של הסיכונים, אך התהליך עדיין באמצע הדרך ושונה מאוד ממדינה למדינה.

שאלות נפוצות ❓

מה ההבדל בין 'בינה מלאכותית יוצרת' ל'מודל גנרטיבי'?

מודל גנרטיבי הוא המונח הטכני למנגנון המתמטי שלומד להפיק דוגמאות-תוכן חדשות; בינה מלאכותית יוצרת הוא הכינוי הציבורי-מוצרי למערכות בפועל שבנויות על מודלים כאלה ומיועדות לשימוש מעשי, כמו ChatGPT או כלי יצירת-תמונות.

מתי ולמה המונח הפך כל-כך נפוץ?

המונח התבסס בציבור הרחב מאז השקת ChatGPT בנובמבר 2022 — עד אז הוא היה שגור בעיקר בקרב חוקרים, ותוך חודשים בודדים הפך לביטוי יומיומי בתקשורת ובשיחות רגילות.

אילו ארכיטקטורות עומדות מאחורי כלי בינה מלאכותית יוצרת?

בעיקר שלוש: מודל דיפוזיה ליצירת תמונות, רשת יריבה גנרטיבית (GAN) בדור קודם יותר של כלי-תמונה, ומודל שפה גדול מבוסס-טרנספורמר ליצירת טקסט; הבחירה תלויה בסוג-התוכן המבוקש.

מהן המגבלות המרכזיות של בינה מלאכותית יוצרת?

היכולת "להזות" — לייצר תשובות בטוחות-לכאורה אך שגויות; שאלות פתוחות סביב זכויות-יוצרים על נתוני-האימון; ופער בין קצב-האימוץ המהיר של הטכנולוגיה לרגולציה שעדיין מתגבשת.