רגרסיה (Regression)
הגדרה
רגרסיה היא משימת למידה-מפוקחת שבה המודל חוזה ערך מספרי רציף (כמו מחיר או טמפרטורה) במקום קטגוריה — בשונה מסיווג, שמכריע בין אפשרויות מוגדרות.
בעוד שסיווג עונה "לאיזו קבוצה זה שייך", רגרסיה עונה "מה הערך המדויק" — למשל, לא רק "יקר/זול" אלא המחיר הצפוי בפועל, בהתבסס על מאפייני הפריט.
המונח עצמו מקורו דווקא בסטטיסטיקה של המאה ה-19, לא ב-AI: פרנסיס גלטון טבע אותו ב-1886 במאמר על תורשת-גובה, אחרי שגילה ש"רגרסיה לממוצע" — הורים גבוהים-במיוחד נוטים להוליד ילדים נמוכים-מהם-במעט, וההפך — היא תופעה סטטיסטית עקבית.
הצורה הפשוטה ביותר, "רגרסיה ליניארית" (Linear Regression), מנסה להתאים קו-ישר יחיד שעובר הכי-קרוב שאפשר לכל נקודות-הנתונים — עדיין בשימוש נרחב היום, לא רק כמבוא-לימודי, בזכות הפשטות והיכולת להסביר בקלות למה המודל הגיע לתחזית מסוימת. שם מטעה שכדאי להכיר: "רגרסיה לוגיסטית" (Logistic Regression), למרות שמה, היא בעצם אלגוריתם-סיווג ולא רגרסיה — היא מנבאת הסתברות (ערך בין 0 ל-1) שמתורגמת לקטגוריה, לא ערך רציף פתוח.
תחזית מחירי-דירות לפי גודל ומיקום, תחזית מזג-אוויר, ותחזית ביקוש למוצר — כולן דוגמאות למשימות רגרסיה, שבהן התשובה היא מספר על סקאלה רציפה, לא קטגוריה סגורה. גם רשתות-נוירונים עמוקות יכולות לבצע רגרסיה — לא רק המודלים הסטטיסטיים הקלאסיים — למשל בחיזוי מחיר-מניה או תוחלת-חיים של רכיב מכני, כשהשכבה האחרונה של הרשת פשוט מפיקה מספר בודד במקום התפלגות-הסתברות על פני קטגוריות.
הערכת-איכות של מודל-רגרסיה שונה גם היא מהערכת-סיווג: במקום "אחוז-דיוק", משתמשים במדדים כמו שגיאה-ריבועית-ממוצעת (Mean Squared Error) — כמה רחוקות בממוצע התחזיות מהערך-האמיתי, כשטעויות גדולות נענשות חזק יותר מטעויות קטנות באותה מידה יחסית.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות