הבעיה: כמה טקסט אנושי איכותי יש בעולם
מודלי-שפה גדולים אומנו עד כה בעיקר על טקסט שנכתב בידי בני-אדם וזמין ברשת — מאמרים, ספרים, קוד, פורומים. קבוצת-המחקר Epoch AI פרסמה ניתוח שלפיו המלאי הכולל של טקסט אנושי איכותי וזמין-לציבור עומד על כ-300 טריליון טוקנים לאחר סינון-איכות, וכי המלאי הזה צפוי 'להתמצות במלואו' אי-שם בין 2026 ל-2032, תלוי בעד כמה אינטנסיבית ימשיכו לאמן מודלים עליו וכמה פעמים יעברו על אותם הנתונים. זו הרחבה של הערכה קודמת מ-2022, שתוקנה לאור עדות חדשה לכך שאפשר לאמן מודלים על אותו מאגר-נתונים יותר מפעם אחת בלי פגיעה משמעותית באיכות.
הפתרון שנבחר: לתת למודל לייצר לעצמו את חומר-הלימוד
'נתונים סינתטיים' הם דוגמאות-טקסט, שיחה או פתרון שמייצר מודל-AI עצמו — ולא נאספים מבני-אדם — ומשמשים לאחר מכן לאימון או לכיוונון-עדין של מודל אחר, או של אותו מודל בגרסה מתקדמת יותר. הרעיון אינו חדש, אך היקף השימוש בו גדל משמעותית מ-2023 ואילך, במקביל ישירות לתקופה שבה החלה להתפרסם עדות מתועדת על מחסור צפוי בטקסט אנושי. מעבדות-AI לא מציגות את זה כתחליף מוחלט לנתונים אנושיים אלא כתוסף שמאפשר להמשיך להרחיב את היקף-האימון גם כשהטקסט האנושי הזמין מפסיק לגדול באותו קצב.
מי כבר עושה את זה בפומבי, ואיך
Microsoft הייתה מהראשונות שתיארה את זה בגלוי: הדוח הטכני של Phi-3 קובע ש'החידוש טמון כולו במערך-האימון... המורכב מנתוני-רשת מסוננים-בקפדנות ומנתונים סינתטיים', ושהמודל אומן על 3.3 טריליון טוקנים בגישה הזו. Anthropic השתמשה בעקרון דומה כבר ב-15 בדצמבר 2022, בשיטה שכינתה 'Constitutional AI': המודל מבקר ומתקן את התשובות של עצמו לפי רשימת-עקרונות כתובה, ומאומן על-סמך התיקונים שהוא עצמו ייצר — לפי ניסוח החברה, זה מאפשר 'לשלוט בהתנהגות-AI בצורה מדויקת יותר ועם הרבה פחות תיוגים אנושיים'. Meta תיארה במאמר-המחקר על Llama 3 (יולי 2024) כיצד יצרה כמיליון דיאלוגי-קוד סינתטיים בעזרת Llama 3 עצמו, וכן פתרונות-מתמטיקה 'צעד-אחר-צעד' וטקסט-הקשר-ארוך סינתטי, כשלדבריה, בכל הנוגע לנתוני-הכוונון להקשר-ארוך, היא 'נשענת ברובה על נתונים סינתטיים' כדי למלא את הפער. NVIDIA פרסמה ב-15 באפריל 2025 מודל וגם מערך-אימון שלם, Llama-Nemotron, שנבנה באופן סינתטי באמצעות מודלים פתוחים כמו DeepSeek-R1.
למה סינתטי: לא רק מחסור
המחסור הצפוי הוא רק סיבה אחת. השנייה היא שליטה על איכות: Microsoft בחרה לייצר 'טקסט באיכות-ספר-לימוד' ממוקד-נושא במקום לסנן מתוך ים-נתונים לא-אחיד. השלישית היא סינון-בטיחות: נתון סינתטי שנוצר תחת עקרונות מוגדרים-מראש, כמו ב-Constitutional AI, נמנע מראש מתוכן פוגעני או פרטי שמאפיין נתוני-רשת גולמיים. הרביעית היא עלות ומהירות: ייצור מיליוני דוגמאות-אימון באמצעות מודל קיים זול ומהיר משמעותית מאיסוף ותיוג אנושי באותו היקף — זו בדיוק הסיבה שמאחורי מערך 30 מיליון הדוגמאות הסינתטיות ש-NVIDIA שחררה בפומבי.
הסיכון המתועד: 'קריסת-מודל'
ב-24 ביולי 2024 פרסם צוות-חוקרים מאוקספורד, קיימברידג', אימפריאל קולג' לונדון וטורונטו מאמר בכתב-העת Nature שמתאר תופעה שכינו 'קריסת-מודל' (model collapse): כשמודל מאומן שוב ושוב על תוכן שמודלים קודמים ייצרו, בלי בקרה, הוא 'שוכח' בהדרגה את התפלגות-הנתונים האמיתית, וה'זנבות' של ההתפלגות המקורית — המקרים הנדירים אך החשובים — נעלמים ראשונים. פרופ' ירין גל מאוקספורד, אחד החוקרים, תיאר זאת כך: 'קריסת-מודל היא המקבילה, בעולם הבינה המלאכותית, ללולאת-משוב שהשתבשה. ככל שמודלים ניזונים יותר מהפלט של עצמם, כך הם מתרחקים יותר מהמציאות. קריסת-מודל מאיימת ליצור תא-הד של בינה מלאכותית'. החוקרים המליצו לשמר גישה לנתונים אנושיים-מקוריים ולפתח מנגנוני מעקב-מקור לנתוני-אימון.
מגמה בשלבים מוקדמים, לא מסקנה סגורה
גם Epoch AI, שהציבו את בעיית-המחסור על סדר-היום, מזהירים שלא להתייחס לנתונים סינתטיים כפתרון מוכח: לדבריהם, 'נתונים סינתטיים שנוצרו על-ידי AI עדיין אינם מובנים דיו', והם הראו שיפור אמין בעיקר בתחומים צרים כמו מתמטיקה וכתיבת-קוד — לא באופן גורף. בפועל, כל המעבדות שסקרנו כאן משלבות נתונים סינתטיים לצד נתונים אנושיים, לא במקומם: Llama 3 עדיין נשען על תיוג-אנושי בשלב הראשון, ו-Phi-3 עדיין כולל 'נתוני-רשת מסוננים' לצד הסינתטיים. השילוב הזה, יחד עם קיומו המתועד של סיכון-קריסת-מודל, הופך את זה למירוץ שעוד לא ברור לאן בדיוק הוא מוביל — לא לתחזית שכבר הוכרעה.