עידן אימון (Epoch)
הגדרה
עידן אימון הוא מעבר אחד שלם של המודל על כל מערך-נתוני-האימון — אימון טיפוסי כולל עשרות או מאות עידנים כאלה, כל אחד משפר מעט את דיוק המודל.
במקום להראות למודל את הנתונים פעם אחת בלבד, מאמנים אותו על אותם נתונים שוב ושוב — כל מעבר מלא נקרא עידן. בכל עידן המודל "רואה" את אותן דוגמאות מזוויות מעט שונות (בגלל הסדר האקראי, ולעיתים בשילוב טכניקות-הגדלה קלות של הנתונים).
לגבי מודלים קטנים יחסית — ולגבי משימות ראייה-ממוחשבת קלאסיות, כמו אימון CNN על מערך-הנתונים ImageNet — אימון של תשעים עידנים ומעלה נחשב סטנדרט מקובל. אבל מודלי שפה גדולים הפכו את זה כמעט על פניו: לפי מחקר מכונן מ-2022 מאת מעבדת (DeepMind, מקבוצת Google) שכונה "Chinchilla", רוב מודלי השפה המודרניים מאומנים על פחות מעידן אחד שלם — כלומר, המודל אפילו לא מספיק "לראות" את כל הנתונים פעם אחת, כי כמות הנתונים כל-כך עצומה.
מעקב מעשי אחרי התקדמות-האימון נעשה בדרך-כלל באמצעות "עקומת-למידה" (Learning Curve) — גרף שמראה את ערך פונקציית-האיבוד בסוף כל עידן, גם על נתוני-האימון וגם על קבוצת-האימות. מפתחים גם שומרים "נקודת-ביקורת" (Checkpoint) — עותק של כל הפרמטרים — בסוף כל עידן, כדי לחזור אליו אם משהו משתבש בהמשך, בלי להתחיל את כל האימון מחדש.
יותר מדי עידנים עלולים לגרום למודל לשנן את נתוני-האימון בעל-פה במקום ללמוד דפוסים כלליים (ראו התאמת-יתר) — לכן מנטרים את הביצועים על קבוצת-אימות ועוצרים כשההשתפרות נעצרת. הטכניקה הזו נקראת "עצירה מוקדמת" (Early Stopping), והיא אחת השיטות הפשוטות והאפקטיביות ביותר למניעת התאמת-יתר, כי היא לא דורשת לשנות כלום בארכיטקטורת המודל עצמה — רק להפסיק את האימון בזמן הנכון.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות