היקף מערכי האימון (Training Dataset Size)
הגדרה
מערכי האימון גדלו מ-300 מיליארד טוקנים ב-GPT-3 בשנת 2020 ל-15.6 טריליון ב-Llama 3.1 בשנת 2024 — וכמות הטקסט האנושי הזמינה מוגבלת.
מ-300 מיליארד ל-15.6 טריליון טוקנים
מודל לומד מטקסט, וכמות הטקסט נמדדת בטוקנים — יחידות קצרות ממילה. GPT-3 אומן ב-2020 על כ-300 מיליארד טוקנים. Llama 3.1 של Meta אומן ביולי 2024 על 15.6 טריליון — פי חמישים ושתיים בארבע שנים. לפי דוח מדד ה-AI של סטנפורד ממהדורת 2025, היקף מערכי האימון של מודלי שפה מכפיל את עצמו בערך כל שמונה חודשים.
ממה מורכב מערך אימון: הפירוק של GPT-3
שווה לראות ממה מורכב מערך כזה בפועל. הרכב נתוני האימון של GPT-3, שפורסם ב-2020, היה כ-60 אחוזים מארכיון הסריקה הפתוח Common Crawl, כ-22 אחוזים מאוסף טקסטים שנאסף מקישורים ברשת, כ-16 אחוזים מספרים, וכ-3 אחוזים בלבד מוויקיפדיה כולה. ההפתעה כאן היא בדרך-כלל האחרונה: ויקיפדיה, המקור המסודר והאמין ביותר בערימה, היא חלק זעיר ממנה.
פרט אחד בפירוק הזה ראוי לתשומת לב: המשקלים אינם זהים לגודל בפועל. Common Crawl תרם 410 מיליארד טוקנים ואוסף הקישורים 19 מיליארד בלבד — אך האוסף הקטן קיבל משקל של 22 אחוזים מהאימון, כלומר המודל ראה אותו שוב ושוב. איכות נמדדת כאן בחזרות, לא רק בנפח.
כמה טקסט אנושי בכלל קיים
קצב כזה מעלה שאלה מתבקשת: כמה טקסט אנושי בכלל קיים. מכון המחקר Epoch AI פרסם ביוני 2024 הערכה שלפיה מלאי הטקסט הציבורי שנוצר בידי בני אדם, אחרי סינון איכות והסרת כפילויות, עומד על כ-300 טריליון טוקנים — בטווח-סמך של 90 אחוזים שבין 100 טריליון ל-1,000 טריליון. הטווח הרחב הזה הוא חלק מהתשובה, לא הערת שוליים לה.
מתי המלאי ייגמר — והתחזית שכבר תוקנה פעם אחת
באותה עבודה נקבע טווח סבירות של 80 אחוזים לכך שהמלאי הזה ינוצל במלואו אי-שם בין 2026 ל-2032, כשהתאריך המדויק תלוי בעיקר בשאלה כמה פעמים מודלים מאומנים על אותו חומר. ראוי לציין שההערכה הזו עצמה הייתה עדכון: בגרסה מ-2022 חזו החוקרים מיצוי של טקסט איכותי כבר ב-2024, והתוצאות החדשות דחו זאת ל-2028 לכל המוקדם. שני ממצאים שינו את החישוב — שסינון קפדני של נתוני רשת עובד טוב יותר מאוסף ערוך בקפידה, ושאפשר לאמן על אותו מערך יותר מפעם אחת בלי נזק משמעותי.
למה להיזהר מהמספר הזה
העדכון הזה הוא גם הסיבה הטובה ביותר להיזהר: זו תחזית על התנהגות עתידית של תעשייה, לא מדידה, והיא כבר תוקנה פעם אחת בכיוון המקל. שווה גם לזכור שהיא מתייחסת לטקסט ציבורי בלבד — לא לטקסט שנמצא מאחורי חומות תשלום, לא לארכיונים פרטיים של ארגונים, ולא לווידאו ולאודיו, שהם מאגר גדול בהרבה שרק התחילו לנצל.
המספר האחרון הידוע, ולמה אין חדש ממנו
נכון לספטמבר 2026, 15.6 הטריליון של Llama 3.1 מיולי 2024 הם עדיין הנתון הגבוה ביותר שפורסם רשמית עבור מודל חזיתי. Kimi K3, המודל הגדול ביותר ברשימה הפומבית נכון להיום, פרסם את מספר הפרמטרים שלו אך לא את היקף מערך האימון שלו. זה אותו דפוס שקורה בצד השני של המדידה, בספירת הפרמטרים: ככל שהמודלים מתקרבים לגבול המלאי, כך פוחת המידע הפומבי על מה בדיוק נכנס אליהם.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
שאלות נפוצות ❓
כמה נתונים נדרשים כדי לאמן מודל שפה גדול?
GPT-3 אומן ב-2020 על כ-300 מיליארד טוקנים; Llama 3.1 אומן ביולי 2024 על 15.6 טריליון — פי חמישים ושתיים בארבע שנים. לפי דוח מדד ה-AI של סטנפורד, ההיקף מכפיל את עצמו בערך כל שמונה חודשים.
ממה מורכב מערך אימון בפועל?
לפי הפירוק שפורסם ל-GPT-3: כ-60 אחוזים מארכיון הסריקה Common Crawl, כ-22 אחוזים מאוסף טקסטים מקישורים ברשת, כ-16 אחוזים מספרים, וכ-3 אחוזים בלבד מוויקיפדיה כולה.
האם הטקסט האנושי הזמין באמת עומד להיגמר?
לפי הערכת Epoch AI מיוני 2024, מלאי הטקסט הציבורי עומד על כ-300 טריליון טוקנים, בטווח-סמך של 90 אחוזים שבין 100 ל-1,000 טריליון. טווח הסבירות של 80 אחוזים למיצוי מלא הוא בין 2026 ל-2032 — טווח רחב, שמעיד על כמה אי-ודאות יש כאן.
למה כדאי להתייחס לתחזית המיצוי בזהירות?
כי זו תחזית על התנהגות עתידית של תעשייה, לא מדידה, והיא כבר תוקנה פעם אחת: גרסה מ-2022 חזתה מיצוי כבר ב-2024, והעדכון דחה זאת ל-2028 לכל המוקדם. היא גם מתייחסת לטקסט ציבורי בלבד, לא לארכיונים פרטיים ולא לווידאו ולאודיו.
מהו הנתון העדכני ביותר שפורסם רשמית?
15.6 טריליון טוקנים, ב-Llama 3.1 מיולי 2024. נכון לספטמבר 2026 לא פורסם היקף מערך אימון גבוה ממנו למודל חזיתי — Kimi K3 מיולי 2026 פרסם את מספר הפרמטרים שלו אך לא את היקף הנתונים.