נתוני אימון (Training Data)
הגדרה
נתוני אימון (Training Data) הם כמות גדולה של דוגמאות שמזינים למודל AI כדי שילמד מהן לזהות תבניות, לפני שהוא מוכן לשימוש.
נתוני אימון (Training Data) הם כמות גדולה של דוגמאות — טקסט, תמונות, קול, או כל סוג מידע אחר — שמזינים למודל AI כדי שילמד מהן לזהות תבניות, לפני שהוא מוכן לשימוש בפועל. הן שונות משני מערכי-נתונים נוספים שנלווים אליהן בתהליך האימון: קבוצת האימות (Validation Set), שמשמשת לכוונון החלטות-עיצוב תוך כדי האימון, וקבוצת המבחן (Test Set), שנשארת "סמויה" מהמודל לחלוטין ומשמשת רק להערכה סופית בלתי-מוטה.
איכות וכמות נתוני האימון הן הגורם המכריע ביותר באיכות המודל הסופי — עיקרון שנקרא בתחום "זבל בפנים, זבל בחוץ". נתונים חלקיים, לא-מייצגים, או מוטים משתקפים ישירות באיכות ובהטיות (ראו הטיה אלגוריתמית) של המודל שנוצר מהם.
מודלי שפה גדולים מאומנים על טריליוני מילים שנאספו מהאינטרנט, ספרים וקוד — כמות שקשה לתפוס: במודל (GPT — Generative Pre-trained Transformer) בגרסת GPT-3, למשל, הוקצה לגרסה המסוננת של Common Crawl משקל של 60% בתערובת האימון (410 מיליארד טוקנים) — Common Crawl הוא ארכיון-אינטרנט-פתוח שסורק מחדש מיליארדי דפי-רשת מדי חודש. כל ויקיפדיה האנגלית כולה, לשם השוואה, מהווה רק אחוזים בודדים מחומר האימון של מודל טיפוסי גדול.
מאז 2024 עולה בתעשייה דאגה שכונתה "קיר הנתונים" (Data Wall) — החשש שכמות הטקסט האנושי האיכותי הזמין באינטרנט מתקרבת למיצוי, אחרי ששאבו ממנה כבר יותר מעשור. תשובה נפוצה היא נתונים סינתטיים (Synthetic Data) — טקסט שמודל AI אחר מייצר במיוחד לצורך אימון מודל נוסף — גישה שמעוררת בעצמה חשש ל"קריסה מודלית" (Model Collapse): ירידה הדרגתית באיכות כשמודל לומד בעיקר מפלט של מודלים קודמים, ולא ממקור אנושי מקורי. תגובה נוספת של חברות ה-AI המובילות היא הסכמי-רישוי ישירים מול בעלי-תוכן — כמו עסקאות שחתמה OpenAI מול הוצאות-חדשות גדולות ומול פורום Reddit — כדי להבטיח גישה חוקית ומתמשכת לנתוני-טקסט איכותיים, במקום להסתמך רק על סריקה חופשית של האינטרנט.
לפני האימון נהוג לבצע עיבוד מקדים (Data Preprocessing), שעשוי לכלול טיפול בערכים חסרים או שגויים, סינון, נרמול והמרה לייצוג שהמודל יכול לעבוד איתו — ולאופן שבו עושים זאת יש השפעה גדולה על התוצאה. ב-GPT-3, למשל, תיארה OpenAI שלושה צעדים לשיפור איכות הנתונים: סינון גרסה של Common Crawl לפי דמיון לאוספי-טקסט איכותיים, הסרת מסמכים כפולים או דומים מאוד, והוספת אוספים איכותיים מוכרים לתערובת.
שאלה נפרדת היא מקור הנתונים ותיעודם (Data Provenance): מאיפה הגיע כל מערך-נתונים, מי יצר אותו ובאיזה רישיון מותר להשתמש בו. ביקורת רחבה שפורסמה ב-2023 בשם The Data Provenance Initiative בדקה יותר מ-1,800 מערכי-טקסט נפוצים, ודיווחה על השמטת פרטי הרישיון בשיעורים של 70% ומעלה ועל טעויות בסיווג הרישיון בשיעורים של 50% ומעלה במטא-נתונים של אתרי-אירוח נפוצים שנבדקו. חוק הבינה המלאכותית האירופי מחייב ספקים של מודלים לשימוש כללי לפרסם סיכום מפורט דיו של התוכן ששימש לאימון. חשוב להבחין: תיעוד מקור נתוני-האימון עוסק בקלט של המודל, ואינו זהה לסימון תוכן שנוצר ב-AI, שעוסק בפלט.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות