דלג לתוכן

היפר-פרמטר (Hyperparameter)

יסודות בינה מלאכותית

הגדרה

היפר-פרמטר הוא הגדרה שנבחרת לפני תחילת האימון (כמו קצב-למידה או גודל-אצווה) — בניגוד לפרמטרים הרגילים של המודל, שהאימון עצמו לומד ומעדכן.

בעוד שהמודל "לומד" בעצמו את הפרמטרים שלו (המשקלים) מתוך הנתונים, היפר-פרמטרים הם החלטות-עיצוב שמישהו — מהנדס אנושי, או תהליך-חיפוש אוטומטי — קובע מראש: כמה עידני-אימון, אצווה בגודל כמה, קצב-למידה כמה מהיר, וכמה שכבות תכיל הרשת.

מציאת ההיפר-פרמטרים הטובים ביותר היא בעצמה בעיית-חיפוש: לפעמים עושים זאת ידנית בניסוי-וטעייה, אבל שיטות אוטומטיות כמו "חיפוש-רשת" (בדיקת כל השילובים האפשריים בתוך טווח נתון) או "אופטימיזציה בייסיאנית" (ניחוש חכם יותר איפה כדאי לחפש הלאה) חוסכות זמן ניכר כשיש הרבה היפר-פרמטרים לכוון בו-זמנית. גישה נוספת, AutoML, מנסה לאוטומט את כל תהליך-הבחירה — כולל ארכיטקטורת-הרשת עצמה, לא רק ההיפר-פרמטרים שלה — כך שמהנדס אנושי כמעט לא נדרש להתערב ידנית.

במודלי-שפה-גדולים, חיפוש-היפר-פרמטרים מלא הוא לרוב בלתי-אפשרי כלכלית: אימון-ניסיון בודד עולה מיליוני דולרים, כך שאי-אפשר פשוט לנסות עשרות שילובים כמו ברשת קטנה. הפתרון המקובל הוא להריץ ניסויים על מודלים קטנים בהרבה, ולהשתמש ב"חוקי-קנה-מידה" (Scaling Laws) כדי לחזות אילו היפר-פרמטרים יעבדו טוב גם במודל הגדול בהרבה שבאמת רוצים לאמן — במקום לגלות זאת בניסוי-וטעייה יקר על המודל המלא עצמו.

בחירת היפר-פרמטרים משפיעה דרמטית על תוצאת האימון — קצב-למידה גבוה מדי עלול לגרום למודל "לקפוץ" מעבר לפתרון הטוב, ונמוך מדי הופך את האימון לאיטי בלתי-נסבל. בגלל זה מעבדות-המחקר הגדולות משקיעות משאבי-מחקר עצומים רק בשאלת ההיפר-פרמטרים עצמה, כחלק בלתי-נפרד מפיתוח כל דור חדש של מודל — טעות בבחירת קצב-הלמידה בלבד יכולה להפוך ריצת-אימון של מיליוני דולרים לכישלון מוחלט, גם כשכל שאר העיצוב תקין.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו