דלג לתוכן

למידת רובוטים (Robot Learning)

רובוטיקה

הגדרה

למידת רובוטים היא תחום המחקר שבו למידת מכונה פוגשת רובוטיקה: במקום שמהנדס יתכנת כל תנועה מראש, הרובוט רוכש מיומנויות — אחיזה, הליכה, קיפול כביסה — מתוך הדגמות של בני אדם, מניסוי וטעייה ומנתונים שנאספו ברובוטים אחרים.

💡 דוגמה

מפעיל מזיז שתי ידיות, והזרועות של הרובוט מחקות אותו ומדיחות מחבת.

אחרי כמה עשרות הדגמות כאלה, הרובוט מנסה לבצע את אותה משימה לבד.

במקום לתכנת כל תנועה

רובוט תעשייתי קלאסי עושה בדיוק מה שתכנתו לו: מהנדס מגדיר נקודות, מהירויות וסדר פעולות, והזרוע חוזרת עליהם אלפי פעמים. זה עובד מצוין כשהחלק תמיד מונח באותו מקום, ונכשל כשהעולם קצת משתנה — חפץ בצבע אחר, מגבת מקופלת אחרת, דלת שנפתחת לכיוון ההפוך. למידת רובוטים היא תחום המחקר שבו למידת מכונה פוגשת רובוטיקה, ומטרתו לאפשר לרובוט לרכוש מיומנויות חדשות או להסתגל לסביבה באמצעות אלגוריתמי למידה. המיומנויות האלה הן בעיקר חושיות-תנועתיות — הליכה, אחיזה, זיהוי חפצים — וגם מיומנויות של אינטראקציה, כמו עבודה משותפת עם אדם על אותו חפץ או הבנת הוראה במילים.

שלוש דרכים ללמוד

רובוט יכול ללמוד בשלוש דרכים עיקריות, ולכל אחת מהן יש באתר ערך משלה. הראשונה היא למידה מהדגמה, או למידת חיקוי: אדם מבצע את המשימה, לרוב בהפעלה מרחוק של הרובוט עצמו, והמערכת לומדת לחקות את הקשר בין מה שהרובוט רואה לבין מה שעשה המפעיל. השנייה היא למידת חיזוק: הרובוט מנסה, נכשל ומקבל ציון, ולאט משפר את התנהגותו. השלישית היא אימון בסימולציה והעברה למציאות, שבה מאמנים מספר עצום של ניסיונות במחשב, מהר ובלי לשבור דבר, ואז מתמודדים עם הפער בין העולם המדומה לעולם האמיתי.

בעיית הנתונים: אין אינטרנט של תנועות

מודלי שפה למדו מכמויות עצומות של טקסט שכבר היה קיים ברשת. לרובוטים אין מאגר כזה: כל דוגמה של אחיזה או הליכה צריך לייצר בעולם הפיזי, ברובוט אמיתי ובזמן אמת. הגוף הפיזי עצמו מוסיף קושי: הרבה משתנים שצריך לשלוט בהם בבת אחת, ומגבלות של זמן אמת על איסוף הנתונים ועל הלמידה. ניסוי מוכר של סרגיי לוין ועמיתיו המחיש את המחיר: בין 6 ל-14 זרועות רובוטיות ביצעו יותר מ-800,000 ניסיונות אחיזה במשך חודשיים, ומהם אומנה רשת נוירונים שלמדה לחזות, מתוך תמונה ממצלמה אחת, אם תנועה של הזרוע תסתיים באחיזה מוצלחת. בניסויים היא הצליחה לאחוז גם בחפצים שלא ראתה קודם. התוצאה הייתה תיאום עין-יד שנלמד מניסיון ולא תוכנת ביד — אבל במחיר של חוות רובוטים שעבדה חודשים.

הדגמות זולות: המקרה של Mobile ALOHA

דרך אחרת להתמודד עם בעיית הנתונים היא להוזיל את איסוף ההדגמות. ב-Mobile ALOHA, פרויקט של זיפנג פו, טוני ז'או וצ'לסי פין מאוניברסיטת סטנפורד, בנו החוקרים מערכת זולה להפעלה מרחוק של כל גוף הרובוט — שתי זרועות על בסיס נייד — כדי לאסוף הדגמות במהירות. לפי המאמר, עם 50 הדגמות לכל משימה, ובאימון משולב עם נתונים קיימים שנאספו בגרסה הנייחת של המערכת, הרובוט למד לבצע לבד משימות כמו טיגון ושירות של שרימפס, פתיחת ארון כפול כדי לאחסן סירים כבדים, הזמנת מעלית וכניסה אליה, ושטיפה קלה של מחבת. דף הפרויקט מבחין בין סרטונים של הפעלה מרחוק לבין סרטונים של ביצוע עצמאי — הבחנה שחשוב לשים לב אליה בכל סרטון רובוט מרשים.

לשתף ניסיון בין רובוטים

אם כל מעבדה אוספת נתונים לבד, ההתקדמות איטית. הרעיון לשתף ניסיון בין רובוטים אינו חדש: פרויקט RoboEarth תואר כ"רשת עולמית לרובוטים", שבה רובוטים מחליפים ידע דרך הענן. הגרסה המודרנית שלו היא מאגרים משותפים גדולים. Open X-Embodiment, שיתוף פעולה של 21 מוסדות, איחד נתונים מ-22 רובוטים שונים, שמדגימים 527 מיומנויות. החוקרים הראו שמודל אחד שאומן על כל הנתונים האלה, RT-X, שיפר את הביצועים של כמה רובוטים שונים בזכות ניסיון שנאסף ברובוטים אחרים. מכאן הדרך קצרה למודלי יסוד לרובוטים. דוגמה לכך היא π0 של חברת Physical Intelligence, שפורסם באוקטובר 2024: הוא בנוי על גבי מודל ראייה-שפה שאומן מראש על ידע בהיקף של האינטרנט, אומן על רובוטים בעלי זרוע אחת, בעלי שתי זרועות ועל רובוטים ניידים, והודגם במשימות כמו קיפול כביסה, ניקוי שולחן והרכבת קופסאות.

כלים פתוחים, ומה עדיין קשה

התחום נפתח גם למי שאינו מעבדת מחקר גדולה. ספריית הקוד הפתוח LeRobot של Hugging Face מציעה מודלים, מאגרי נתונים וכלים לרובוטיקה בעולם האמיתי, תומכת בזרועות זולות כמו SO-100 ו-SO-101, וכוללת שיטות למידה מהדגמה, מודלי ראייה-שפה-פעולה ושיטות של למידת חיזוק. ועדיין, הקושי הבסיסי לא נעלם. כבר ב-1988 כתב חוקר הרובוטיקה הנס מורבק שקל יחסית לגרום למחשב להגיע לרמת מבוגר במבחני אינטליגנציה או בדמקה, וקשה או בלתי אפשרי לתת לו את כישורי התפיסה והתנועה של תינוק בן שנה. למידת רובוטים היא אחד הניסיונות המרכזיים לסגור את הפער הזה, אבל רובוט שלמד משימה במטבח אחד עדיין עלול להיכשל במטבח אחר, וכל כישלון בעולם הפיזי עולה בזמן, בכסף ולעיתים בחומרה שבורה.

📬 הגיליון השבועי של Wiki-AI

פעם בשבוע, ביום ראשון: שלושת הדברים החשובים שקרו בעולם הבינה המלאכותית, בעברית פשוטה, וערכים חדשים באנציקלופדיה. לגיליונות

שאלות נפוצות ❓

מה ההבדל בין למידת רובוטים לבין רובוט מתוכנת רגיל?

רובוט מתוכנת מבצע רצף תנועות שמהנדס הגדיר מראש. בלמידת רובוטים, הרובוט רוכש את המיומנות מתוך נתונים — הדגמות, ניסוי וטעייה או סימולציה — ולכן יכול, לפחות בחלק מהמקרים, להתמודד עם מצבים שלא תוכננו מראש.

איך רובוט לומד מהדגמה?

אדם מבצע את המשימה, בדרך כלל בהפעלה מרחוק של הרובוט, והמערכת שומרת מה הרובוט ראה ומה עשה המפעיל. מתוך הרבה הדגמות כאלה לומדת המערכת לחקות את ההתנהגות. ב-Mobile ALOHA של סטנפורד הספיקו 50 הדגמות למשימה, באימון משולב עם נתונים קיימים.

למה קשה כל כך לאסוף נתונים לרובוטים?

כי בניגוד לטקסט ולתמונות, אין מאגר מוכן ברשת. כל דוגמה צריך לייצר ברובוט אמיתי ובזמן אמת. בניסוי של סרגיי לוין ועמיתיו נדרשו יותר מ-800,000 ניסיונות אחיזה, על בין 6 ל-14 זרועות, במשך חודשיים.

מה זה Open X-Embodiment?

מאגר נתונים משותף שאיחד ניסיון מ-22 רובוטים שונים, משיתוף פעולה של 21 מוסדות. מודל שאומן עליו, RT-X, שיפר ביצועים של כמה רובוטים בזכות ניסיון שנאסף ברובוטים אחרים.

האם סרטוני רובוטים מרשימים מראים למידה אמיתית?

לא תמיד. חלק מהסרטונים מציגים הפעלה מרחוק בידי אדם ולא ביצוע עצמאי. פרויקטים רציניים מבחינים בין השניים במפורש, וכדאי לבדוק איזה מהם מוצג.

אפשר להתנסות בזה בבית?

במידה מסוימת. ספריית LeRobot של Hugging Face פתוחה לכולם, ותומכת בזרועות זולות כמו SO-100 ו-SO-101, עם מאגרי נתונים ומודלים מוכנים.

שתפו:וואטסאפטלגרם

מצאתם טעות בערך, או שיש לכם מקור שכדאי להוסיף? כתבו לנו