arrow_forwardמדריכים / Computer-Use Agents
מעודכן ליולי 2026 14 דקות קריאה מתקדם

Computer-Use — סוכנים
שמפעילים את המחשב

עד עכשיו סוכני AI השתמשו ב-API. הדור הבא רואה מסך, מזיז עכבר ומקליד — בדיוק כמו אדם. סוכני Computer-Use מפעילים כל תוכנה בממשק הגרפי שלה, גם כזו בלי API. במדריך: איך זה עובד, הכלים (Claude Computer Use, Operator, Mariner), מקרי שימוש, והסיכונים שאסור להתעלם מהם.

Screenshot
רואה מסך
Click
מזיז עכבר
Type
מקליד
Loop
עד להשלמה

מה זה סוכן Computer-Use

סוכן Computer-Use הוא מודל AI מולטימודלי שמקבל צילום מסך של מחשב או דפדפן, מחליט מה לעשות, ומחזיר פעולה — "לחץ בנקודה (x,y)", "הקלד את הטקסט הזה", "גלול למטה". אתה מריץ את הפעולה, מצלם מסך חדש, ומחזיר לו. הלולאה חוזרת עד שהמשימה מושלמת.

זהו שינוי מהותי: במקום שסוכן יזדקק ל-API לכל שירות, הוא מפעיל את הממשק הגרפי כמו בן אדם. המשמעות — הוא יכול לתפעל כל תוכנה, כולל מערכות legacy ישנות, אתרים ללא API, ותוכנות דסקטופ.

terminal
סוכן רגיל (Tool/API)
מדבר עם שירותים דרך API מובנה. מהיר ואמין — אבל רק למה שיש לו API.
desktop_windows
סוכן Computer-Use
רואה מסך ומפעיל ממשק גרפי. גמיש לכל תוכנה — אבל איטי יותר ופחות דטרמיניסטי.

איך זה עובד — לולאת Perceive → Reason → Act

כל סוכני ה-Computer-Use פועלים באותה לולאה בסיסית, שרצה עד שהמשימה מסתיימת או שנדרש אישור אנושי:

photo_camera
1. Perceive — צילום מסך
הסוכן מקבל תמונה של המסך הנוכחי (ולעיתים גם עץ הנגישות של הדף). זה ה"עיניים" שלו.
psychology
2. Reason — החלטה
המודל מנתח את המסך מול המטרה ומחליט על הצעד הבא — מזהה איפה נמצא הכפתור הרלוונטי.
ads_click
3. Act — פעולה
מחזיר פעולה מובנית: click(x,y), type("..."), scroll, key. הסביבה מבצעת אותה.
loop
4. Repeat — חזרה
צילום מסך חדש חוזר למודל, והלולאה נמשכת. לפעולות רגישות — עצירה לאישור אנושי (Human-in-the-Loop).
info
למה זה עדיין בגרסת beta

זיהוי מדויק של קואורדינטות מתוך תמונה קשה. הסוכן עלול ללחוץ במקום הלא נכון, לפספס אלמנטים דינמיים, או להתקשות ב-CAPTCHA. הדיוק משתפר מהר, אבל למשימות קריטיות עדיין נדרשת פיקוח אנושי.

הכלים המובילים ב-2026

כלי מאת סביבה
Claude Computer UseAnthropicמחשב מלא (API)
Operator / ChatGPT AgentOpenAIדפדפן בענן
Project MarinerGoogle DeepMindדפדפן (Chrome)
browser-use (Open Source)קהילהדפדפן, self-host

מקרי שימוש אמיתיים

quiz
QA ובדיקות אוטומטיות
בדיקת flow שלם באפליקציה מנקודת מבט המשתמש, כולל מסכים שקשה לבדוק עם קוד רגיל.
move_to_inbox
הזנת נתונים למערכות ישנות
מערכת ERP/CRM ישנה בלי API? הסוכן ממלא טפסים ומעביר נתונים דרך המסך.
shopping_cart
מחקר ורכש web
השוואת מחירים באתרים, מילוי סל קניות, איסוף מידע ממספר מקורות — עבודת דפדפן ידנית.
support_agent
אוטומציית תהליכים תפעוליים
משימות חוזרות בין כמה מערכות שאין ביניהן אינטגרציה — הסוכן מגשר דרך הממשק.

אבטחה — הסיכון הגדול של סוכני Computer-Use

סוכן שיכול ללחוץ ולהקליד בכל מקום הוא גם משטח תקיפה חדש. הסיכונים הכי חשובים:

shield
כללי הגנה — לפני שאתה מריץ בפרודקשן

הרץ תמיד ב-סביבה מבודדת (VM / container), עם הרשאות מינימליות ובלי גישה לחשבונות אמיתיים ללא צורך. הוסף אישור אנושי לכל פעולה רגישה (תשלום, מחיקה, שליחה). הגבל אילו אתרים הסוכן יכול לגשת אליהם (allow-list). ולעולם אל תיתן לסוכן אוטונומי גישה בלתי מוגבלת למחשב האישי שלך. הרחבה מלאה במדריך אבטחת הסוכנים ובמדריך Prompt Injection.

מגבלות — מתי לא להשתמש

מגבלההפתרון המומלץ
יש API לשירותהשתמש ב-API / MCP — מהיר ואמין יותר
משימה קריטית לדיוקאוטומציה דטרמיניסטית (Playwright/n8n)
מהירות וקנה מידהComputer-Use איטי — לא ל-throughput גבוה
CAPTCHA / anti-botחסם מובנה — לרוב לא יעבור
lightbulb
הגישה הנכונה: API קודם, מסך כ-fallback

Computer-Use הוא לא תחליף ל-API ולאוטומציה רגילה — הוא ה-fallback לכל מה שאין לו API. תכנן את הסוכן שלך כך שיעדיף כלים (MCP) כשהם קיימים, וייפול חזרה לשליטה במסך רק כשאין ברירה. כך תקבל את המהירות של API עם הגמישות של ממשק גרפי.