לימודים באוניברסיטת מישיגן
אנדרו בארטו נולד ב-1948. הוא קיבל תואר ראשון במתמטיקה מאוניברסיטת מישיגן ב-1970, ודוקטורט במדעי-המחשב מאותה אוניברסיטה ב-1975; עבודת-הדוקטורט שלו, 'Cellular Automata as Models of Natural Systems', הונחתה בידי ברנרד זייגלר.
אוניברסיטת מסצ'וסטס אמהרסט
ב-1977 הצטרף בארטו לאוניברסיטת מסצ'וסטס אמהרסט כחוקר-פוסט-דוקטורט, התמנה לפרופסור-חבר ב-1982 ולפרופסור מן המניין ב-1991, ושימש ראש-המחלקה למדעי-המחשב בין 2007 ל-2011. הוא ניהל במשותף את מעבדת-הלמידה-האוטונומית (Autonomous Learning Laboratory) של האוניברסיטה, ופרש ב-2012 כפרופסור-אמריטוס.
הדרכת סאטון והתאם הפועל-המבקר
בין 1980 ל-1984 הנחה בארטו את עבודת-הדוקטורט של ריצ'רד סאטון באמהרסט. עוד בתקופה זו, ב-1983, פרסמו בארטו, סאטון וצ'רלס אנדרסון יחד את המאמר 'Neuronlike Adaptive Elements That Can Solve Difficult Learning Control Problems' בכתב-העת IEEE Transactions on Systems, Man, and Cybernetics — מאמר שהניח את רוב היסודות הרעיוניים של שיטת 'שחקן-מבקר' (Actor-Critic) המשמשת עד היום בלמידת-חיזוק, והדגים אותה על בעיית איזון-מוט על עגלה נעה. משם ואילך פיתחו בארטו וסאטון יחד את המסגרת המתמטית הכללית של תהליכי-החלטה מרקוביים לתיאור סביבות שבהן התגמול אינו ידוע מראש.
הספר Reinforcement Learning: An Introduction
ב-1998 פרסמו בארטו וסאטון יחד את הספר Reinforcement Learning: An Introduction, שהפך לספר-הלימוד הסטנדרטי של התחום; מהדורה שנייה יצאה ב-2018. לפי אוניברסיטת מסצ'וסטס אמהרסט, הספר מצוטט מעל 75,000 פעמים, והמסגרת המתמטית שהציג משמשת בסיס למערכות כמו AlphaGo של Google DeepMind.
מהאלגוריתם למוח: הקשר לדופמין
מסגרת-האיתות של שגיאת-הפרש-זמני (TD error) שפיתחו בארטו וסאטון בשנות ה-80 וה-90 הפכה בהמשך, בעבודתם של חוקרי-מוח כמו וולפרם שולץ, פיטר דיין ורִיד מונטגיו, למודל-המפתח להסבר האופן שבו נוירוני-דופמין בגרעיני-הבסיס מקודדים שגיאת-חיזוי-תגמול — אחד מקווי-החיבור המשמעותיים ביותר בין מדעי-המחשב התאורטיים לנוירוביולוגיה של הלמידה.
למידה-מונעת-פנימית: מעבר לתגמול חיצוני
מעבר לשיתוף-הפעולה עם סאטון, הוביל בארטו קו-מחקר עצמאי על 'למידת-חיזוק מונעת-פנימית' (Intrinsically Motivated Reinforcement Learning) — ניסיון להסביר כיצד סוכן יכול לבנות ולהרחיב מיומנויות שימושיות גם בהיעדר תגמול חיצוני מוגדר-מראש, בהשראת מחקר פסיכולוגי על סקרנות והתפתחות. קו-המחקר הזה, שפרסם ב-2004 עם נוטפונג צ'נטנז וסטינדר סינג, השפיע רבות על תחומי הרובוטיקה ההתפתחותית והלמידה-ההיררכית.
פרס טיורינג 2024 ופרסים נוספים
בארטו זכה בפרס-החלוצים לרשתות-נוירונים (Neural Networks Pioneer Award) של IEEE ב-2004, ובפרס-המצוינות-המחקרית של IJCAI ב-2017, 'על מחקר פורץ-דרך ובעל-השפעה הן בתאוריה והן ביישום של למידת-החיזוק'. ב-5 במרץ 2025 הכריזה ACM כי בארטו וסאטון זוכים יחד בפרס טיורינג 2024 — פרס כספי של מיליון דולר, הממומן בידי גוגל — 'על פיתוח היסודות הרעיוניים והאלגוריתמיים של למידת-החיזוק'. בארטו נבחר לחבר (Fellow) של IEEE ב-2005, והוא גם חבר באגודה האמריקאית לקידום-המדע (AAAS).