לימודים ודוקטורט אצל בארטו
ריצ'רד סאטון נולד ב-1957 בטולדו שבאוהיו, וגדל באוק-ברוק שבאילינוי. הוא קיבל תואר ראשון בפסיכולוגיה מאוניברסיטת סטנפורד ב-1978, ולאחר-מכן תואר שני (1980) ודוקטורט (1984) במדעי-המחשב מאוניברסיטת מסצ'וסטס אמהרסט. עבודת-הדוקטורט שלו, 'Temporal Credit Assignment in Reinforcement Learning', הונחתה בידי אנדרו בארטו — שיתוף-הפעולה שממנו צמח רוב מחקרם המשותף בעשורים הבאים.
התאם-הפועל-המבקר: מאמר 1983 עם בארטו
עוד כתלמיד-הדוקטורט של בארטו פרסם סאטון איתו ועם צ'רלס אנדרסון, ב-1983, את המאמר 'Neuronlike Adaptive Elements That Can Solve Difficult Learning Control Problems' בכתב-העת IEEE Transactions on Systems, Man, and Cybernetics — המאמר שהניח את רוב היסודות הרעיוניים של שיטת 'שחקן-מבקר' (Actor-Critic) המשמשת עד היום בלמידת-חיזוק. ב-1988 פרסם סאטון לבדו את המאמר 'Learning to Predict by the Methods of Temporal Differences' בכתב-העת Machine Learning, שהציג לראשונה באופן שיטתי את משפחת שיטות למידת-ההפרש-הזמני.
קריירה: מ-GTE ל-AT&T
לאחר פוסט-דוקטורט קצר באמהרסט עבד סאטון בשנים 1985–1994 כחבר-סגל-טכני-ראשי במעבדות GTE בוולת'ם שבמסצ'וסטס, שב לאמהרסט כחוקר-בכיר בין 1994 ל-1998, ולאחר-מכן עבד במעבדת שאנון של AT&T Labs בין 1998 ל-2002. בתקופה זו פרסם ב-1991 את ארכיטקטורת 'Dyna' — גישה המשלבת למידה מניסיון ישיר עם תכנון באמצעות מודל-פנימי מדומה של הסביבה — והמשיך לפתח את שיטות-הגרדיאנט-המדיניות (Policy-Gradient Methods) עם קירוב-פונקציה, לצד מסגרת 'האופציות' (Options Framework) להפשטה זמנית בלמידת-חיזוק.
הספר עם בארטו ופרס טיורינג 2024
ב-1998 פרסמו סאטון ובארטו יחד את הספר Reinforcement Learning: An Introduction, שהפך לספר-הלימוד הסטנדרטי של התחום; מהדורה שנייה, מורחבת, יצאה ב-2018. לפי אוניברסיטת מסצ'וסטס אמהרסט, הספר מצוטט מעל 75,000 פעמים. ב-5 במרץ 2025 הכריזה ACM כי סאטון ובארטו זוכים יחד בפרס טיורינג 2024 — פרס כספי של מיליון דולר, הממומן בידי גוגל — 'על פיתוח היסודות הרעיוניים והאלגוריתמיים של למידת-החיזוק'.
אלברטה, דיפמיינד ו'הלקח המר'
מ-2003 מכהן סאטון כפרופסור למדעי-המחשב באוניברסיטת אלברטה שבקנדה, וב-2015 קיבל אזרחות קנדית. בין 2017 ל-2023 שימש גם חוקר-בכיר-מובחן ב-Google DeepMind. ב-2019 פרסם את המאמר 'הלקח המר' (The Bitter Lesson), הטוען ששיטות כלליות המנצלות עוצמת-חישוב מנצחות בטווח הארוך על-פני פתרונות מהונדסים-ידנית; המאמר נדון בערך נפרד באתר, ואינו מפורט כאן. סאטון הוא חבר האגודה המלכותית של קנדה (2016) והאגודה המלכותית בלונדון (2021).
Keen Technologies ו-Oak Lab
ב-2023 הצטרף סאטון כחוקר למעבדת Keen Technologies של ג'ון קרמאק, מפתח משחקי-הווידאו Doom ו-Quake, כדי לקדם יחד מחקר לקראת בינה מלאכותית כללית. ב-2026 עזב סאטון את Keen Technologies וייסד, עם חורם ג'אווד, את המעבדה העצמאית Oak Lab בקנדה, שמטרתה לפתח סוכני-בינה-מלאכותית הלומדים ברציפות מהסביבה שלהם, בלי הסתמכות בלבדית על אימון-מוקדם.