היקף מערכי האימון (Training Dataset Size)

נתוני AI

הגדרה

מערכי האימון גדלו מ-300 מיליארד טוקנים ב-GPT-3 בשנת 2020 ל-15.6 טריליון ב-Llama 3.1 בשנת 2024 — וכמות הטקסט האנושי הזמינה מוגבלת.

מודל לומד מטקסט, וכמות הטקסט נמדדת בטוקנים — יחידות קצרות ממילה. GPT-3 אומן ב-2020 על כ-300 מיליארד טוקנים. Llama 3.1 של Meta אומן ביולי 2024 על 15.6 טריליון — פי חמישים ושתיים בארבע שנים. לפי דוח מדד ה-AI של סטנפורד ממהדורת 2025, היקף מערכי האימון של מודלי שפה מכפיל את עצמו בערך כל שמונה חודשים.

שווה לראות ממה מורכב מערך כזה בפועל. הרכב נתוני האימון של GPT-3, שפורסם ב-2020, היה כ-60 אחוזים מארכיון הסריקה הפתוח Common Crawl, כ-22 אחוזים מאוסף טקסטים שנאסף מקישורים ברשת, כ-16 אחוזים מספרים, וכ-3 אחוזים בלבד מוויקיפדיה כולה. ההפתעה כאן היא בדרך-כלל האחרונה: ויקיפדיה, המקור המסודר והאמין ביותר בערימה, היא חלק זעיר ממנה.

קצב כזה מעלה שאלה מתבקשת: כמה טקסט אנושי בכלל קיים. מכון המחקר Epoch AI פרסם ביוני 2024 הערכה שלפיה מלאי הטקסט הציבורי שנוצר בידי בני אדם, אחרי סינון איכות והסרת כפילויות, עומד על כ-300 טריליון טוקנים.

באותה עבודה נקבע טווח סבירות של 80 אחוזים לכך שהמלאי הזה ינוצל במלואו אי-שם בין 2026 ל-2032, כשהתאריך המדויק תלוי בעיקר בשאלה כמה פעמים מודלים מאומנים על אותו חומר. ראוי לציין שההערכה הזו עצמה הייתה עדכון: בגרסה מ-2022 חזו החוקרים מיצוי כבר ב-2024, ותיקנו את התחזית אחרי שהתברר שסינון קפדני של נתוני רשת עובד טוב יותר מהצפוי ושאפשר לאמן על אותו מערך יותר מפעם אחת.

העדכון הזה הוא גם הסיבה הטובה ביותר להיזהר: זו תחזית על התנהגות עתידית של תעשייה, לא מדידה, והיא כבר תוקנה פעם אחת בכיוון המקל. שווה גם לזכור שהיא מתייחסת לטקסט ציבורי בלבד — לא לטקסט שנמצא מאחורי חומות תשלום, לא לארכיונים פרטיים של ארגונים, ולא לווידאו ולאודיו, שהם מאגר גדול בהרבה שרק התחילו לנצל.