הלולאה: תמונת-מסך, החלטה, פעולה, ושוב
אדם שיושב מול מחשב אינו זקוק לממשק מיוחד כדי להשתמש בתוכנה: הוא רואה את המסך, מזיז את העכבר ומקליד. שימוש במחשב (Computer Use) הוא היכולת לעשות בדיוק את זה כשהמפעיל הוא סוכן בינה מלאכותית, ובאותם אמצעים בדיוק: הסוכן מקבל תמונה של המסך, מחליט מה לעשות, ומבצע — מזיז את הסמן, לוחץ, מקליד, גולל. אחר-כך הוא מקבל תמונה חדשה של המסך, רואה מה קרה בעקבות הפעולה, ומחליט שוב. אין כאן ממשק ייעודי שמישהו בנה עבורו ואין קוד שנכתב מראש לכל מסך; הכניסה היחידה היא מה שרואים על המסך, והיציאה היחידה היא אותם עכבר ומקלדת שהיו שם ממילא.
אנת'רופיק, שהציגה יכולת כזו במודל שלה ב-22 באוקטובר 2024, תיארה אותה בדיוק כך: המודל יכול למלא פקודות של משתמש, להזיז סמן על מסך המחשב שלו, ללחוץ במקומות הרלוונטיים, ולהזין מידע דרך מקלדת וירטואלית. באותה הודעה היא גם תיארה את המגבלה המובנית של הגישה: המודל רואה את המסך כרצף של תמונות-סטילס, כמו ספר-הנפשה שמדפדפים בו, ולכן הוא עלול לפספס דברים קצרי-מועד — התראה שקופצת ונעלמת, או שינוי שמתרחש בין שתי תמונות. אותה הודעה גם ציינה שהיכולת איטית ונוטה לשגיאות, ושפעולות שגרתיות כמו גרירה או שינוי-מרחק-תצוגה אינן זמינות למודל כלל.
הסיבה שמישהו טורח לעשות את זה כך, במקום להתחבר ישירות לתוכנה, מעשית לחלוטין: רוב מה שנמצא על מחשב ארגוני אינו חושף שום דרך תקנית להתחבר אליו מבחוץ. מערכת בת עשרים שנה, תוכנה שנרכשה עם רישיון סגור, מסך פנימי שמישהו בנה פעם ואיש כבר אינו מתחזק — כולם עדיין עובדים מצוין דרך המסך, ורק דרכו. סוכן שיודע להפעיל מסך אינו זקוק לשיתוף-פעולה מצד מי שבנה את התוכנה, ואינו זקוק לרשותו.
מול RPA: תסריט מוקלט מול החלטה מול המסך
ההשוואה שהכי מבהירה את המנגנון היא מול אוטומציה רובוטית של תהליכים (RPA) — טכנולוגיה ותיקה בהרבה, שגם היא מפעילה תוכנה דרך המסך, בלי גישה תכנותית ישירה אליה. ההבדל אינו במה שקורה על המסך אלא במי שמחליט מה יקרה בו.
ב-RPA מישהו הגדיר מראש את הרצף המלא: לחץ על הכפתור במיקום הזה, המתן, העתק את השדה ההוא, הדבק כאן, שלח. זה עובד היטב, מהר וזול, כל עוד המסך נראה בדיוק כפי שנראה ביום שבו התסריט נכתב. ברגע שהעיצוב התחדש, ששדה החליף מקום בטופס או שמסך-הסכמה חדש נוסף לפני הכניסה — התסריט אינו מזהה שמשהו השתנה. הוא ממשיך לפי המפה הישנה, ולכן או נעצר או מקליד לתוך השדה הלא-נכון: הוא אינו מבין מה מולו, הוא משחזר תנועות שמישהו הקליט עבורו.
שימוש במחשב עובד הפוך: אין תסריט. בכל צעד הוא מסתכל על המסך כפי שהוא ברגע זה, מזהה מה נמצא שם, ומחליט מה הצעד הבא לאור המטרה שנתנו לו. כשהכפתור זז, הוא פשוט רואה אותו במקומו החדש וממשיך. זו בדיוק הסיבה שהגישה מעניינת, וזו גם בדיוק הסיבה שהיא פחות צפויה: מערכת שמחליטה מחדש בכל צעד יכולה גם להחליט לא נכון, ואי-אפשר לקרוא מראש את רשימת-הפעולות שהיא עומדת לבצע — כי הרשימה הזו עדיין לא קיימת בשום מקום.
מכאן שהשתיים אינן מחליפות זו את זו. לתהליך יציב, זהה בכל יום, שרץ באלפי חזרות — תסריט קבוע עדיין זול, מהיר ואמין יותר, ואין שום סיבה להחליף אותו במודל שמחליט מחדש בכל פעם. הערך של הגישה הזו מתחיל בדיוק במקום שבו התסריט נשבר: במסכים שמשתנים, בחריגים, ובמשימות שאיש לא הקליט מראש.
מול אוטומציית דפדפן: אותה משימה, שתי רמות של גישה
קרוב-משפחה שני הוא אוטומציית דפדפן — שליטה תוכנתית בדפדפן לצורך גלישה, לחיצה ומילוי טפסים. ההבדל נמצא בשתי נקודות.
הראשונה היא מה המערכת בכלל רואה. כלי קלאסי לאוטומציה של דפדפן קורא את מבנה הדף עצמו — הקוד שמתחתיו — ומאתר את הכפתור לפי הזיהוי שלו בקוד, לא לפי מראהו על המסך. זה מדויק ומהיר מאוד כשזה עובד, ושביר כשמישהו משנה את הקוד שמתחת גם בלי לשנות דבר במראה. סוכן שמשתמש במחשב מסתכל על התמונה: הוא מזהה כפתור מפני שהוא נראה כמו כפתור, בדיוק כמו שאדם מזהה אותו — ולכן שינוי בקוד שאינו משנה את המראה אינו מפריע לו כלל.
השנייה היא היקף-הפעולה, וזה ההבדל המשמעותי יותר בפועל. אוטומציית-דפדפן, מעצם הגדרתה, נעצרת בגבול חלון הדפדפן. סוכן שמשתמש במחשב פועל על כל שולחן-העבודה: הוא יכול לפתוח קובץ מקומי, להעתיק ממנו נתון לתוך אפליקציה מותקנת, לשמור פלט, ורק אז לפתוח דפדפן ולהמשיך שם. משימות ארגוניות אמיתיות חוצות לרוב כמה תוכנות שאינן מדברות ביניהן — גיליון, מערכת פנימית, דואר, אתר של ספק — וזו הסיבה שהאבחנה הזו חשובה בפועל ולא רק לצורך הגדרה מסודרת. מנגד, המחיר על ההיקף הרחב הזה הוא איטיות: לכידת תמונה, ניתוחה, והחלטה מחדש בכל צעד יקרות בהרבה מקריאה ישירה של מבנה-דף.
כמה טוב זה עובד באמת: מה אומרים המספרים
התחום נמדד בעיקר מול מבחן בשם OSWorld, שפורסם ב-2024. המאמר שהציג אותו מתאר סביבת-מחשב אמיתית התומכת במערכות-הפעלה שונות — אובונטו, ווינדוס ו-macOS — ובתוכה בנו החוקרים מבחן של 369 משימות-מחשב, עם יישומי-רשת ויישומי-שולחן-עבודה אמיתיים, עבודה עם קבצים ותהליכים שחוצים כמה יישומים. הפער שדיווחו עליו היה עצום: בני-אדם השלימו יותר מ-72.36% מהמשימות, בעוד המודל הטוב ביותר שנבדק שם הגיע ל-12.24% בלבד. החוקרים ייחסו את הפער בעיקר לשתי חולשות — קושי לעגן את מה שרואים על המסך למיקום המדויק שאליו צריך ללחוץ, וחוסר בידע תפעולי בסיסי על האופן שבו דברים עובדים במערכת.
המספרים זזו מהר מאז. בהודעה מ-22 באוקטובר 2024 דיווחה אנת'רופיק שהמודל שלה מגיע ל-14.9% באותו מבחן, מול 7.7% של המודל הטוב הבא אחריו, כשביצועי בני-אדם באותה מדידה עמדו על 70%–75%. בינואר 2025 הציגה OpenAI מודל בשם Computer-Using Agent (בקיצור CUA), ודווח עליו 38.1% ב-OSWorld ו-58.1% במבחן WebArena, שבודק משימות בדפדפן בלבד. דוח מדד ה-AI של אוניברסיטת סטנפורד ממהדורת 2026 מביא את המדידה העדכנית: הדיוק ב-OSWorld עלה מכ-12 אחוזים ל-66.3 אחוזים בתוך שנה — כשש נקודות-אחוז מתחת לביצועי אדם. הערך קצב השיפור באמות-המידה מציג את הקפיצה הזו לצד קפיצות דומות בשני מבחנים אחרים.
שני דברים כדאי לקרוא מהמספרים האלה. הראשון הוא הקצב: אותו מבחן שבו המודל הטוב ביותר עמד על 12.24% הגיע לכ-66.3% תוך פחות משנתיים. השני הוא שהפער לא נסגר: 66.3 אחוזים מול יותר מ-72.36 אחוזים אצל בני-אדם נשמע פער קטן, אבל פירושו שכשליש מהמשימות עדיין נכשלות — ולכן משימה שסוכן כזה מבצע היום היא משימה שצריך לבדוק אחריה, לא משימה שאפשר לשלוח ולשכוח ממנה.
מחלקת-סיכון אחרת: הרשאות אמיתיות על מחשב אמיתי
עד כאן זו נשמעת כמו שאלה של יכולת. היא אינה רק כזו. סוכן שמשתמש במחשב הוא, בהגדרה, תוכנה שיושבת מול מחשב מחובר, ודרכו היא מחוברת לכל מה שהמשתמש שלו מחובר אליו: תיבת-הדואר הפתוחה, המערכת הפיננסית שהוא כבר מזוהה בה, הקבצים שעל שולחן-העבודה. סוכן שמדבר בלבד יכול לכל היותר לומר משהו שגוי; סוכן שמפעיל מחשב יכול ללחוץ על שלח, על אשר או על מחק.
הסיכון החריף ביותר כאן הוא הזרקת פרומפט. אנת'רופיק ציינה אותו במפורש כבר בהודעה הראשונה שלה על היכולת, והגדירה אותו כתקיפה שבה הוראות זדוניות מוגשות למודל וגורמות לו לעקוף את ההנחיות הקודמות שקיבל או לבצע פעולות בלתי-מכוונות. בהקשר של מסך זה מוחשי במיוחד: הטקסט הזדוני אינו חייב להגיע מהמשתמש כלל — מספיק שהוא כתוב בתוך דף שהסוכן פתח, בתוך מסמך שהוא נדרש לקרוא, או אפילו בתוך תמונה שמופיעה על המסך. הסוכן קורא את המסך, ומה שכתוב על המסך אינו נושא תווית שמבדילה בין נתון שצריך לקרוא לבין פקודה שצריך לבצע.
מכאן שהפרקטיקה הרצינית בתחום אינה לתת גישה ולקוות לטוב, אלא שילוב של כמה שכבות שכבר קיימות בעולם הסוכנים. ארגז חול — מחשב וירטואלי מבודד, עם חשבונות נפרדים ובלי גישה למה שאין צורך בו — הוא הצעד הראשון והפשוט ביותר, והוא מוריד את חומרת התקלה מפגיעה אמיתית לפגיעה בעותק.
אדם-בלולאה נדרש בנקודות הבלתי-הפיכות: תשלום, שליחה, מחיקה, חתימה — צעד שאי-אפשר לבטל אחרי שנעשה ראוי לאישור אנושי, גם במחיר האטת התהליך.
נצפוּת סוכנים נדרשת מפני שבלעדיה אי-אפשר בכלל לענות בדיעבד על השאלה מה הסוכן ראה ברגע שבו קיבל את ההחלטה השגויה — כאן, בשונה מתוכנה רגילה, אין שורת-קוד שאפשר להצביע עליה ולומר שהיא הבאג.
המנגנון נשאר, המוצרים מתחלפים
תולדות המוצרים בתחום הזה הן שיעור בפני עצמו על ההבדל בין מנגנון לבין מוצר. OpenAI השיקה ב-23 בינואר 2025 שירות בשם Operator, שהריץ סוכן כזה עבור משתמשים; ב-31 באוגוסט 2025 השירות נסגר, אחרי שהוחלף במוצר אחר בשם ChatGPT agent; וגם זה הוסר מ-ChatGPT בתחילת אוגוסט 2026. המוצרים באו והלכו, בעוד היכולת עצמה לא נעלמה לרגע — היא רק המשיכה להיארז מחדש תחת שמות אחרים.
זו הסיבה שהערך הזה מתאר מנגנון ולא מוצר. השאלה הרלוונטית לארגון אינה באיזה כלי להשתמש, כי הכלי יתחלף ממילא, אלא לאילו משימות הגישה הזו בכלל מתאימה — והתשובה היא בדיוק אלה שאין להן חלופה: מערכות ישנות בלי ממשק חיצוני, תהליכים שחוצים כמה תוכנות שאינן מדברות ביניהן, ובדיקות-איכות של תוכנה, שבהן הצפייה במסך בדיוק כמו משתמש היא היתרון ולא הפשרה. במקומות שבהם קיים חיבור תקני ויציב, כמעט תמיד עדיף להשתמש בו: הוא מהיר, זול ואמין יותר מלחיצות על תמונת מסך.
והנקודה האחרונה, שקל לפספס: שימוש במחשב אינו יכולת נפרדת ומנותקת אלא מקרה-קצה של קריאה לכלים. בכל שאר המקרים הכלי הוא ממשק מוגדר שמישהו חשף במכוון, עם רשימה סגורה של פעולות מותרות; כאן הכלי הוא העכבר והמקלדת, וההרשאה שניתנה איתם רחבה כמעט כמו זו של האדם שיושב מול המחשב. משם נגזר כל השאר — גם התועלת הגדולה, שאינה תלויה בשיתוף-פעולה של אף ספק, וגם הזהירות שהגישה הזו מחייבת יותר מכל צורה אחרת של אוטומציה.