מירוץ הנתונים הסינתטיים (Synthetic Data Race)

מגמות ועדכונים

הגדרה

מגמה תעשייתית שבה מעבדות-AI מרכזיות מסתמכות במידה גוברת על נתונים שמודל-AI מייצר בעצמו — לצד נתונים אנושיים ולא במקומם — כתגובה מתועדת למחסור צפוי בטקסט אנושי איכותי ולצורך בשליטה על איכות ובטיחות הנתונים.

הבעיה: כמה טקסט אנושי איכותי יש בעולם

מודלי-שפה גדולים אומנו עד כה בעיקר על טקסט שנכתב בידי בני-אדם וזמין ברשת — מאמרים, ספרים, קוד, פורומים. קבוצת-המחקר Epoch AI פרסמה ניתוח שלפיו המלאי הכולל של טקסט אנושי איכותי וזמין-לציבור עומד על כ-300 טריליון טוקנים לאחר סינון-איכות, וכי המלאי הזה צפוי 'להתמצות במלואו' אי-שם בין 2026 ל-2032, תלוי בעד כמה אינטנסיבית ימשיכו לאמן מודלים עליו וכמה פעמים יעברו על אותם הנתונים. זו הרחבה של הערכה קודמת מ-2022, שתוקנה לאור עדות חדשה לכך שאפשר לאמן מודלים על אותו מאגר-נתונים יותר מפעם אחת בלי פגיעה משמעותית באיכות.

הפתרון שנבחר: לתת למודל לייצר לעצמו את חומר-הלימוד

'נתונים סינתטיים' הם דוגמאות-טקסט, שיחה או פתרון שמייצר מודל-AI עצמו — ולא נאספים מבני-אדם — ומשמשים לאחר מכן לאימון או לכיוונון-עדין של מודל אחר, או של אותו מודל בגרסה מתקדמת יותר. הרעיון אינו חדש, אך היקף השימוש בו גדל משמעותית מ-2023 ואילך, במקביל ישירות לתקופה שבה החלה להתפרסם עדות מתועדת על מחסור צפוי בטקסט אנושי. מעבדות-AI לא מציגות את זה כתחליף מוחלט לנתונים אנושיים אלא כתוסף שמאפשר להמשיך להרחיב את היקף-האימון גם כשהטקסט האנושי הזמין מפסיק לגדול באותו קצב.

מי כבר עושה את זה בפומבי, ואיך

Microsoft הייתה מהראשונות שתיארה את זה בגלוי: הדוח הטכני של Phi-3 קובע ש'החידוש טמון כולו במערך-האימון... המורכב מנתוני-רשת מסוננים-בקפדנות ומנתונים סינתטיים', ושהמודל אומן על 3.3 טריליון טוקנים בגישה הזו. Anthropic השתמשה בעקרון דומה כבר ב-15 בדצמבר 2022, בשיטה שכינתה 'Constitutional AI': המודל מבקר ומתקן את התשובות של עצמו לפי רשימת-עקרונות כתובה, ומאומן על-סמך התיקונים שהוא עצמו ייצר — לפי ניסוח החברה, זה מאפשר 'לשלוט בהתנהגות-AI בצורה מדויקת יותר ועם הרבה פחות תיוגים אנושיים'. Meta תיארה במאמר-המחקר על Llama 3 (יולי 2024) כיצד יצרה כמיליון דיאלוגי-קוד סינתטיים בעזרת Llama 3 עצמו, וכן פתרונות-מתמטיקה 'צעד-אחר-צעד' וטקסט-הקשר-ארוך סינתטי, כשלדבריה, בכל הנוגע לנתוני-הכוונון להקשר-ארוך, היא 'נשענת ברובה על נתונים סינתטיים' כדי למלא את הפער. NVIDIA פרסמה ב-15 באפריל 2025 מודל וגם מערך-אימון שלם, Llama-Nemotron, שנבנה באופן סינתטי באמצעות מודלים פתוחים כמו DeepSeek-R1.

למה סינתטי: לא רק מחסור

המחסור הצפוי הוא רק סיבה אחת. השנייה היא שליטה על איכות: Microsoft בחרה לייצר 'טקסט באיכות-ספר-לימוד' ממוקד-נושא במקום לסנן מתוך ים-נתונים לא-אחיד. השלישית היא סינון-בטיחות: נתון סינתטי שנוצר תחת עקרונות מוגדרים-מראש, כמו ב-Constitutional AI, נמנע מראש מתוכן פוגעני או פרטי שמאפיין נתוני-רשת גולמיים. הרביעית היא עלות ומהירות: ייצור מיליוני דוגמאות-אימון באמצעות מודל קיים זול ומהיר משמעותית מאיסוף ותיוג אנושי באותו היקף — זו בדיוק הסיבה שמאחורי מערך 30 מיליון הדוגמאות הסינתטיות ש-NVIDIA שחררה בפומבי.

הסיכון המתועד: 'קריסת-מודל'

ב-24 ביולי 2024 פרסם צוות-חוקרים מאוקספורד, קיימברידג', אימפריאל קולג' לונדון וטורונטו מאמר בכתב-העת Nature שמתאר תופעה שכינו 'קריסת-מודל' (model collapse): כשמודל מאומן שוב ושוב על תוכן שמודלים קודמים ייצרו, בלי בקרה, הוא 'שוכח' בהדרגה את התפלגות-הנתונים האמיתית, וה'זנבות' של ההתפלגות המקורית — המקרים הנדירים אך החשובים — נעלמים ראשונים. פרופ' ירין גל מאוקספורד, אחד החוקרים, תיאר זאת כך: 'קריסת-מודל היא המקבילה, בעולם הבינה המלאכותית, ללולאת-משוב שהשתבשה. ככל שמודלים ניזונים יותר מהפלט של עצמם, כך הם מתרחקים יותר מהמציאות. קריסת-מודל מאיימת ליצור תא-הד של בינה מלאכותית'. החוקרים המליצו לשמר גישה לנתונים אנושיים-מקוריים ולפתח מנגנוני מעקב-מקור לנתוני-אימון.

מגמה בשלבים מוקדמים, לא מסקנה סגורה

גם Epoch AI, שהציבו את בעיית-המחסור על סדר-היום, מזהירים שלא להתייחס לנתונים סינתטיים כפתרון מוכח: לדבריהם, 'נתונים סינתטיים שנוצרו על-ידי AI עדיין אינם מובנים דיו', והם הראו שיפור אמין בעיקר בתחומים צרים כמו מתמטיקה וכתיבת-קוד — לא באופן גורף. בפועל, כל המעבדות שסקרנו כאן משלבות נתונים סינתטיים לצד נתונים אנושיים, לא במקומם: Llama 3 עדיין נשען על תיוג-אנושי בשלב הראשון, ו-Phi-3 עדיין כולל 'נתוני-רשת מסוננים' לצד הסינתטיים. השילוב הזה, יחד עם קיומו המתועד של סיכון-קריסת-מודל, הופך את זה למירוץ שעוד לא ברור לאן בדיוק הוא מוביל — לא לתחזית שכבר הוכרעה.

שאלות נפוצות ❓

מה זה בדיוק 'נתונים סינתטיים' באימון AI?

טקסט, שיחה או פתרון שמייצר מודל-AI עצמו — ולא נאסף מבני-אדם — ומשמש לאחר מכן לאימון או לכיוונון-עדין של אותו מודל או מודל אחר.

למה בכלל צריך נתונים סינתטיים אם יש כל-כך הרבה טקסט באינטרנט?

לפי Epoch AI, המלאי של טקסט אנושי איכותי וזמין-לציבור — כ-300 טריליון טוקנים — צפוי 'להתמצות' בין 2026 ל-2032. מעבר למחסור, נתונים סינתטיים מאפשרים גם שליטה על איכות ועל סינון-תוכן פוגעני, ועלות נמוכה יותר מתיוג אנושי בקנה-מידה גדול.

אילו מעבדות-AI כבר משתמשות בנתונים סינתטיים בפומבי?

Microsoft ב-Phi-3 (נתוני-רשת מסוננים לצד נתונים סינתטיים), Anthropic ב-Constitutional AI מאז דצמבר 2022 (המודל מבקר ומתקן את עצמו), Meta ב-Llama 3 (כמיליון דיאלוגי-קוד סינתטיים ופתרונות-מתמטיקה סינתטיים), ו-NVIDIA, ששחררה במפורש מערך-אימון סינתטי בשם Llama-Nemotron.

מה הסיכון ב'קריסת-מודל' (model collapse)?

מחקר שפורסם ב-Nature ב-24 ביולי 2024 הראה שמודל שמאומן שוב ושוב על תוכן שמודלים קודמים ייצרו, בלי בקרה, שוכח בהדרגה את התפלגות-הנתונים האמיתית — במיוחד את המקרים הנדירים אך החשובים שבה.

האם נתונים סינתטיים יחליפו לגמרי נתונים אנושיים?

לא לפי אף אחת מהמעבדות שסקרנו כאן. כולן ממשיכות לשלב נתונים סינתטיים לצד נתונים אנושיים, לא במקומם — ואפילו Epoch AI, שהציגו את בעיית-המחסור, מזהירים שנתונים סינתטיים עדיין 'לא מובנים דיו' ומראים שיפור אמין בעיקר בתחומים צרים כמו מתמטיקה וקוד.