אלפא-זירו (AlphaZero)
הגדרה
אלפא-זירו היא תוכנה של DeepMind שהוצגה בדצמבר 2017 ולמדה שחמט, שוגי וגו רק מתוך משחק נגד עצמה, בלי ידע אנושי מלבד חוקי המשחק — וניצחה תוכנת אלופה בכל אחד מהם.
💡 דוגמה
אף אחד לא לימד אותה פתיחות שחמט או טריקים של רבי-אמנים.
היא קיבלה רק את החוקים, שיחקה נגד עצמה מיליוני משחקים, ואחרי כ-9 שעות אימון בשחמט ניצחה את Stockfish, התוכנה האלופה.
תוכנה אחת, שלושה משחקים
אלפא-זירו (AlphaZero) היא תוכנה שפיתחה DeepMind, מעבדת הבינה המלאכותית של גוגל. היא הוצגה ב-5 בדצמבר 2017 במאמר טרום-פרסום של דייוויד סילבר ועמיתיו, ולפיו התוכנה התחילה ממשחק אקראי, בלי דוגמאות משחק של בני אדם, ותוך 24 שעות הגיעה לרמה על-אנושית בשחמט, בשוגי (שחמט יפני) ובגו. המאמר דיווח גם על ניצחונות מול תוכנה אלופת עולם בכל אחד מהמשחקים. הגרסה המלאה, עם תוצאות מעודכנות, פורסמה בכתב העת Science ב-7 בדצמבר 2018. החידוש לא היה בעצם הניצחון של מחשב: כבר ב-1997 גבר מחשב השחמט דיפ בלו של IBM על אלוף העולם גארי קספרוב. החידוש היה בדרך. לפי DeepMind, מנועי השחמט החזקים, כמו Stockfish, נשענו על אלפי כללים והיוריסטיקות שניסחו ביד שחקנים חזקים, כדי לכסות כל מצב אפשרי במשחק. אלפא-זירו החליפה את כל זה ברשת נוירונים עמוקה ובאלגוריתמים כלליים: בלי כללי אסטרטגיה ידניים, בלי ספרי פתיחות ובלי טבלאות סיום. מה שהחוקרים כן סיפקו, לפי נספח המאמר, הם חוקי המשחק ואופן הייצוג של הלוח והמהלכים.
משושלת AlphaGo
אלפא-זירו היא חוליה בשושלת של DeepMind. AlphaGo, שניצחה את אלוף הגו לי סה-דול במרץ 2016, למדה ממשחקי גו של בני אדם, ובהמשך ממשחק נגד עצמה. ממשיכתה AlphaGo Zero, שתוארה בכתב העת Nature באוקטובר 2017, כבר לא השתמשה בשום נתוני משחק אנושיים: היא למדה רק ממשחק נגד עצמה, ואחרי שלושה ימי אימון ניצחה 100–0 את הגרסה שגברה על לי סה-דול. אלפא-זירו לקחה את הגישה הזאת צעד הלאה: אותו אלגוריתם הופעל על שלושה משחקים שונים. לפי ויקיפדיה, אחד ההבדלים הוא שבגו אין תיקו, ואילו שחמט ושוגי יכולים להסתיים בתיקו, ולכן אלפא-זירו נדרשה להביא בחשבון גם תוצאה כזאת. ב-2019 הציגה DeepMind את MuZero, שהגיעה לאותה רמה בשלושת המשחקים בלי שנמסרו לה החוקים בכלל, ושיחקה גם במשחקי מחשב של Atari.
איך היא לומדת: מיליוני משחקים נגד עצמה
לפי DeepMind, כדי ללמוד משחק, רשת נוירונים לא מאומנת משחקת מיליוני משחקים נגד עצמה, בתהליך של ניסוי וטעייה שנקרא למידת חיזוק. בהתחלה היא משחקת באקראי לגמרי, ועם הזמן היא לומדת מהניצחונות, מההפסדים ומהתיקו, ומעדכנת את עצמה כך שתעדיף מהלכים טובים. בניסוי שפורסם ב-2018 נמשך האימון בערך 9 שעות לשחמט, 12 שעות לשוגי ו-13 ימים לגו, וכל משחק אומן בעותק נפרד של התוכנה. לפי המאמר, את משחקי האימון ייצרו 5,000 מעבדי TPU מהדור הראשון — שבבים שגוגל פיתחה במיוחד לבינה מלאכותית — ו-16 מעבדים מהדור השני אימנו את הרשתות. במשחק עצמו, הרשת המאומנת מכוונת אלגוריתם חיפוש בשם חיפוש עץ מונטה קרלו, שבודק אילו מהלכים מבטיחים יותר. כאן ההבדל הבולט ממנועי השחמט הקלאסיים: לפי DeepMind, בניסוי שפורסם ב-2018 בדקה אלפא-זירו בשחמט בממוצע כ-60 אלף עמדות בשנייה, לעומת כ-60 מיליון של גרסת Stockfish שנבדקה. לפי ויקיפדיה, היא מפצה על כך בכך שהרשת ממקדת את החיפוש בהמשכים המבטיחים ביותר.
התוצאות, והוויכוח על תנאי המשחק
בגרסה המוקדמת של 2017 שיחקה אלפא-זירו 100 משחקי שחמט נגד Stockfish 8, אלוף אליפות מנועי השחמט TCEC של 2016, בדקה אחת לכל מהלך, וסיימה ב-28 ניצחונות, 72 תיקו ואפס הפסדים. התוצאה עוררה ביקורת. לפי ויקיפדיה, רב-האמן היקרו נקמורה טען שיש פער חומרה גדול: אלפא-זירו רצה לדבריו על מחשב-העל של גוגל, והוא השווה את החומרה של Stockfish למחשב נייד, ואחד ממפתחי Stockfish, טורד רומסטד, ציין שהמנוע לא בנוי לזמן קבוע לכל מהלך ושהגרסה ששיחקה הייתה בת שנה. במאמר המלא ב-Science התייחסה DeepMind לחלק מהטענות: Stockfish קיבל 44 ליבות מעבד, כמו באליפות TCEC, ושני הצדדים שיחקו שלוש שעות למשחק ועוד 15 שניות לכל מהלך. אלפא-זירו רצה על מכונה אחת עם ארבעה מעבדי TPU ו-44 ליבות. בסדרה של 1,000 משחקים היא ניצחה ב-155 והפסידה ב-6, ולפי ויקיפדיה 839 משחקים הסתיימו בתיקו. בשוגי היא ניצחה ב-91.2% מהמשחקים מול Elmo, גרסת האלופה של 2017, ובגו ניצחה ב-61% מהמשחקים מול AlphaGo Zero.
סגנון "זר"
מה שריתק את עולם השחמט היה פחות התוצאה ויותר הסגנון. דמיס הסאביס, מנכ"ל DeepMind ושחקן שחמט בעצמו, תיאר אותו לפי ויקיפדיה כ"זר" — "כמו שחמט מממד אחר". לפי DeepMind, אלפא-זירו מוכנה להקריב כלים מוקדם במשחק בשביל יתרון שיתממש רק בטווח הארוך, ומשחקת כך שהכלים שלה פעילים וניידים ככל האפשר, ושל היריב — כמה שפחות. רב-האמן מתיו סדלר ונטשה ריגן, בעלת תואר אמנית בינלאומית לנשים, ניתחו אלפי משחקים שלה לספר Game Changer, שיצא בינואר 2019, וסדלר השווה את הקריאה בהם לגילוי המחברות הסודיות של שחקן גדול מהעבר. אלוף העולם לשעבר גארי קספרוב, מי שהפסיד לדיפ בלו ב-1997, אמר שאינו יכול להסתיר את שביעות רצונו מכך שהיא משחקת בסגנון דינמי מאוד, "די כמו שלי". באותו גיליון של Science התפרסם גם מאמר פרספקטיבה של מארי קמפבל, מהיוצרים של דיפ בלו. ב-2020 השתמשו חוקרי DeepMind יחד עם אלוף העולם לשעבר ולדימיר קרמניק באלפא-זירו כדי לבדוק גרסאות של שחמט עם שינויים קטנים בחוקים, ולראות איך היו נראים בהן משחקים בין שחקנים חזקים.
למה זו לא בינה מלאכותית כללית
אלפא-זירו מוצגת לפעמים כצעד בדרך לבינה כללית, אבל יש לה גבולות ברורים. היא צריכה לקבל את חוקי המשחק מראש: לפי DeepMind עצמה, מערכות שמחפשות קדימה, כמו אלפא-זירו, נשענות על ידיעת הדינמיקה של הסביבה — חוקי המשחק או סימולטור מדויק — ולכן קשה להפעיל אותן על בעיות מבולגנות בעולם האמיתי. היא נבנתה למשחקים שבהם כל המידע גלוי לשני הצדדים, וכל משחק נלמד אצלה מאפס. ב-2018 כתבה DeepMind שמערכות AI מגיעות לרמה גבוהה מאוד במיומנות מסוימת אבל נכשלות לעיתים קרובות כשהמשימה משתנה מעט, וראתה באלפא-זירו צעד חשוב לקראת פתרון הבעיה — לא את הפתרון. מחקר שפורסם ב-2026 בכתב העת Machine Learning הראה מגבלה נוספת: במשחק נים (Nim), במימושים שנבדקו, סוכנים בסגנון אלפא-זירו הגיעו לרמת אלוף רק על לוחות קטנים מאוד, והביצועים הידרדרו ככל שהלוח גדל. המחברים קשרו זאת לקושי של רשתות נוירונים כלליות ללמוד בעצמן פונקציות מופשטות כמו זוגיות. ההמשך הגיע בכמה כיוונים: MuZero למדה בלי לקבל חוקים; גרסה של אלפא-זירו בשם AlphaDev מצאה אלגוריתמי מיון מהירים יותר, שנוספו לספריית התקן של שפת C++ בפרויקט LLVM; וקהילת השחמט בנתה את Leela Chess Zero, מנוע קוד פתוח שהוכרז בינואר 2018 כדי לשחזר את ההישג.
📬 הגיליון השבועי של Wiki-AI
פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות
| AlphaGo | AlphaGo Zero | אלפא-זירו | MuZero | |
|---|---|---|---|---|
| הוצגה | ינואר 2016 | אוקטובר 2017 | דצמבר 2017 | נובמבר 2019 |
| משחקים | גו | גו | שחמט, שוגי וגו | גו, שחמט, שוגי ו-57 משחקי Atari |
| למדה ממשחקים של בני אדם | כן, ובהמשך גם ממשחק נגד עצמה | לא | לא | לא |
שאלות נפוצות ❓
במה אלפא-זירו שונה מ-AlphaGo?
AlphaGo שיחקה רק גו, ולמדה ממשחקי גו של בני אדם ובהמשך ממשחק נגד עצמה. אלפא-זירו למדה רק ממשחק נגד עצמה, בלי נתוני משחק של בני אדם, ואותו אלגוריתם הופעל על שלושה משחקים: שחמט, שוגי וגו. ביניהן הייתה AlphaGo Zero, שכבר למדה בלי נתונים אנושיים אבל שיחקה רק גו.
האם הניצחון על Stockfish היה הוגן?
על הגרסה המוקדמת של 2017 נמתחה ביקורת: Stockfish קיבל דקה קבועה לכל מהלך, הגרסה שלו הייתה בת שנה, ורב-האמן היקרו נקמורה טען שאלפא-זירו רצה על חומרה חזקה בהרבה. במאמר המלא ב-Science, מ-2018, שיחקו שני הצדדים שלוש שעות למשחק ועוד 15 שניות למהלך, Stockfish קיבל 44 ליבות כמו באליפות TCEC, ואלפא-זירו ניצחה ב-155 משחקים והפסידה ב-6, מתוך 1,000.
אפשר לשחק נגד אלפא-זירו?
לפי ויקיפדיה, התוכנה עצמה לא שוחררה לציבור, אבל האלגוריתם שתואר במאמר מומש בתוכנות פתוחות. הידועה שבהן היא Leela Chess Zero, מנוע שחמט בקוד פתוח שהוכרז בינואר 2018 כדי לשחזר את ההישג.
האם אלפא-זירו היא בינה מלאכותית כללית?
לא. היא צריכה לקבל את חוקי המשחק מראש, נבנתה למשחקים שבהם כל המידע גלוי, ולומדת כל משחק מאפס. DeepMind עצמה כתבה שמערכות כאלה קשות להפעלה על בעיות מבולגנות בעולם האמיתי, ובמחקר מ-2026, במימושים שנבדקו, ביצועי סוכנים בסגנון אלפא-זירו במשחק נים הידרדרו ככל שהלוח גדל.