נתוני אימון (Training Data)
יסודות בינה מלאכותית
נתוני אימון (Training Data) הם כמות גדולה של דוגמאות — טקסט, תמונות, קול, או כל סוג מידע אחר — שמזינים למודל AI כדי שילמד מהן לזהות תבניות, לפני שהוא מוכן לשימוש בפועל.
איכות וכמות נתוני האימון הן הגורם המכריע ביותר באיכות המודל הסופי — עיקרון שנקרא בתחום "זבל בפנים, זבל בחוץ". נתונים חלקיים, לא-מייצגים, או מוטים משתקפים ישירות באיכות ובהטיות (ראו הטיה אלגוריתמית) של המודל שנוצר מהם.
מודלי שפה גדולים מאומנים על טריליוני מילים שנאספו מהאינטרנט, ספרים וקוד — כמות שקשה לתפוס: כל ויקיפדיה האנגלית כולה מהווה רק אחוזים בודדים מחומר האימון של מודל טיפוסי גדול.