XGBoost (קיצור של eXtreme Gradient Boosting) הוא ספריית-תוכנה בקוד-פתוח שמממשת את שיטת חיזוק-הגרדיאנט (Gradient Boosting) בצורה מהירה ויעילה במיוחד להרצה על היקפי-נתונים גדולים. חשוב להבחין בין השניים: חיזוק-גרדיאנט הוא הרעיון התיאורטי הכללי, ו-XGBoost הוא מימוש-הנדסי ספציפי אחד שלו — ספרייה קונקרטית שכל מפתח יכול להתקין ולהריץ, לא שם-נרדף לשיטה עצמה. ספריות מתחרות כמו LightGBM ו-CatBoost מממשות את אותו רעיון תיאורטי בגישות-הנדסיות מעט שונות משלהן, כל אחת עם פשרות-ביצועים משלה בין מהירות, דיוק וצריכת-זיכרון.
הספרייה פורסמה ב-2016 על ידי טיאנצ'י צ'ן וקרלוס גסטרין מאוניברסיטת וושינגטון, במאמר "XGBoost: A Scalable Tree Boosting System" שהוצג בכנס ACM SIGKDD. הפרסום הגיע כמעט חמש-עשרה שנה אחרי מאמרו התיאורטי של ג'רום פרידמן מ-2001 שהניח את יסודות חיזוק-הגרדיאנט — XGBoost לא המציאה את הרעיון, אלא בנתה עליו שכבה הנדסית של אופטימיזציות מחשוביות שהפכו אותו למעשי בקנה-מידה תעשייתי, כולל טיפול חכם בערכים חסרים וריצה מבוזרת על כמה מחשבים במקביל, יכולות שהמאמר המקורי של פרידמן כלל לא נדרש אליהן.
בין התרומות המרכזיות של XGBoost מעבר לחיזוק-גרדיאנט ה"טהור": רגולריזציה מובנית בתוך פונקציית-המטרה עצמה, שמפחיתה נטייה להתאמת-יתר; יכולת עבודה עם נתונים חסרים בלי צורך במילוי מוקדם; וניצול-חומרה יעיל במיוחד (זיכרון-מטמון, דחיסת-נתונים, עיבוד מקבילי) שהופך אימון על מיליוני שורות למעשי על מחשב רגיל, לא רק על תשתית-ענן יקרה. השילוב הזה בין דיוק לביצועים-הנדסיים הוא שהפך את XGBoost לכלי מועדף במיוחד על מדעני-נתונים שעובדים מול היקפי-נתונים ממשיים ולא רק ניסויי-מעבדה, ולא רק על מחקר תיאורטי בסביבת-מעבדה מבוקרת.
XGBoost התפרסמה בזכות הצלחות חוזרות ונשנות בתחרויות מדעי-הנתונים בפלטפורמת Kaggle החל מ-2016, כשמשתתפים רבים השתמשו בה לצורך פתרונות מנצחים בבעיות-סיווג וחיזוי על נתונים טבלאיים — לצד רשתות-נוירונים עמוקות, שנותרות בדרך כלל עדיפות דווקא בתמונות, טקסט וקול. גם היום, כשמדובר בנתונים טבלאיים מובנים כמו רשומות-לקוחות או עסקאות-פיננסיות, XGBoost וספריות דומות לה נשארות לעיתים קרובות הבחירה המעשית הראשונה, גם מול חלופות מבוססות-למידה-עמוקה, בזכות שילוב של דיוק גבוה, זמן-אימון סביר, ופרשנות יחסית נוחה של תוצאות המודל.