אנדרו בארטו (Andrew G. Barto)

היסטוריה ואנשי מפתח

הגדרה

אנדרו בארטו הוא חוקר מדעי-המחשב אמריקאי, מחבר-שותף עם ריצ'רד סאטון של הספר Reinforcement Learning: An Introduction, וזוכה-שותף בפרס טיורינג 2024 על יסודות למידת-החיזוק.

לימודים באוניברסיטת מישיגן

אנדרו בארטו נולד ב-1948. הוא קיבל תואר ראשון במתמטיקה מאוניברסיטת מישיגן ב-1970, ודוקטורט במדעי-המחשב מאותה אוניברסיטה ב-1975; עבודת-הדוקטורט שלו, 'Cellular Automata as Models of Natural Systems', הונחתה בידי ברנרד זייגלר.

אוניברסיטת מסצ'וסטס אמהרסט

ב-1977 הצטרף בארטו לאוניברסיטת מסצ'וסטס אמהרסט כחוקר-פוסט-דוקטורט, התמנה לפרופסור-חבר ב-1982 ולפרופסור מן המניין ב-1991, ושימש ראש-המחלקה למדעי-המחשב בין 2007 ל-2011. הוא ניהל במשותף את מעבדת-הלמידה-האוטונומית (Autonomous Learning Laboratory) של האוניברסיטה, ופרש ב-2012 כפרופסור-אמריטוס.

הדרכת סאטון והתאם הפועל-המבקר

בין 1980 ל-1984 הנחה בארטו את עבודת-הדוקטורט של ריצ'רד סאטון באמהרסט. עוד בתקופה זו, ב-1983, פרסמו בארטו, סאטון וצ'רלס אנדרסון יחד את המאמר 'Neuronlike Adaptive Elements That Can Solve Difficult Learning Control Problems' בכתב-העת IEEE Transactions on Systems, Man, and Cybernetics — מאמר שהניח את רוב היסודות הרעיוניים של שיטת 'שחקן-מבקר' (Actor-Critic) המשמשת עד היום בלמידת-חיזוק, והדגים אותה על בעיית איזון-מוט על עגלה נעה. משם ואילך פיתחו בארטו וסאטון יחד את המסגרת המתמטית הכללית של תהליכי-החלטה מרקוביים לתיאור סביבות שבהן התגמול אינו ידוע מראש.

הספר Reinforcement Learning: An Introduction

ב-1998 פרסמו בארטו וסאטון יחד את הספר Reinforcement Learning: An Introduction, שהפך לספר-הלימוד הסטנדרטי של התחום; מהדורה שנייה יצאה ב-2018. לפי אוניברסיטת מסצ'וסטס אמהרסט, הספר מצוטט מעל 75,000 פעמים, והמסגרת המתמטית שהציג משמשת בסיס למערכות כמו AlphaGo של Google DeepMind.

מהאלגוריתם למוח: הקשר לדופמין

מסגרת-האיתות של שגיאת-הפרש-זמני (TD error) שפיתחו בארטו וסאטון בשנות ה-80 וה-90 הפכה בהמשך, בעבודתם של חוקרי-מוח כמו וולפרם שולץ, פיטר דיין ורִיד מונטגיו, למודל-המפתח להסבר האופן שבו נוירוני-דופמין בגרעיני-הבסיס מקודדים שגיאת-חיזוי-תגמול — אחד מקווי-החיבור המשמעותיים ביותר בין מדעי-המחשב התאורטיים לנוירוביולוגיה של הלמידה.

למידה-מונעת-פנימית: מעבר לתגמול חיצוני

מעבר לשיתוף-הפעולה עם סאטון, הוביל בארטו קו-מחקר עצמאי על 'למידת-חיזוק מונעת-פנימית' (Intrinsically Motivated Reinforcement Learning) — ניסיון להסביר כיצד סוכן יכול לבנות ולהרחיב מיומנויות שימושיות גם בהיעדר תגמול חיצוני מוגדר-מראש, בהשראת מחקר פסיכולוגי על סקרנות והתפתחות. קו-המחקר הזה, שפרסם ב-2004 עם נוטפונג צ'נטנז וסטינדר סינג, השפיע רבות על תחומי הרובוטיקה ההתפתחותית והלמידה-ההיררכית.

פרס טיורינג 2024 ופרסים נוספים

בארטו זכה בפרס-החלוצים לרשתות-נוירונים (Neural Networks Pioneer Award) של IEEE ב-2004, ובפרס-המצוינות-המחקרית של IJCAI ב-2017, 'על מחקר פורץ-דרך ובעל-השפעה הן בתאוריה והן ביישום של למידת-החיזוק'. ב-5 במרץ 2025 הכריזה ACM כי בארטו וסאטון זוכים יחד בפרס טיורינג 2024 — פרס כספי של מיליון דולר, הממומן בידי גוגל — 'על פיתוח היסודות הרעיוניים והאלגוריתמיים של למידת-החיזוק'. בארטו נבחר לחבר (Fellow) של IEEE ב-2005, והוא גם חבר באגודה האמריקאית לקידום-המדע (AAAS).

שאלות נפוצות ❓

מה הקשר בין בארטו לסאטון?

בארטו הנחה את עבודת-הדוקטורט של סאטון באוניברסיטת מסצ'וסטס אמהרסט בין 1980 ל-1984, ומאותה שותפות צמח מרבית המחקר המשותף שהניח את יסודות תחום למידת-החיזוק, ובכלל זה הספר Reinforcement Learning: An Introduction.

על מה קיבל בארטו את פרס טיורינג 2024?

הוא זכה בו יחד עם ריצ'רד סאטון, ב-5 במרץ 2025, 'על פיתוח היסודות הרעיוניים והאלגוריתמיים של למידת-החיזוק' — פרס כספי של מיליון דולר הממומן בידי גוגל.

מה תפקידו של בארטו כיום?

הוא פרופסור-אמריטוס באוניברסיטת מסצ'וסטס אמהרסט מאז 2012, לאחר קריירה שהחלה שם ב-1977 והובילה לפיתוח היסודות המתמטיים והאלגוריתמיים של תחום למידת-החיזוק יחד עם ריצ'רד סאטון.