Computer-Use — סוכנים
שמפעילים את המחשב
עד עכשיו סוכני AI השתמשו ב-API. הדור הבא רואה מסך, מזיז עכבר ומקליד — בדיוק כמו אדם. סוכני Computer-Use מפעילים כל תוכנה בממשק הגרפי שלה, גם כזו בלי API. במדריך: איך זה עובד, הכלים (Claude Computer Use, Operator, Mariner), מקרי שימוש, והסיכונים שאסור להתעלם מהם.
מה זה סוכן Computer-Use
סוכן Computer-Use הוא מודל AI מולטימודלי שמקבל צילום מסך של מחשב או דפדפן, מחליט מה לעשות, ומחזיר פעולה — "לחץ בנקודה (x,y)", "הקלד את הטקסט הזה", "גלול למטה". אתה מריץ את הפעולה, מצלם מסך חדש, ומחזיר לו. הלולאה חוזרת עד שהמשימה מושלמת.
זהו שינוי מהותי: במקום שסוכן יזדקק ל-API לכל שירות, הוא מפעיל את הממשק הגרפי כמו בן אדם. המשמעות — הוא יכול לתפעל כל תוכנה, כולל מערכות legacy ישנות, אתרים ללא API, ותוכנות דסקטופ.
איך זה עובד — לולאת Perceive → Reason → Act
כל סוכני ה-Computer-Use פועלים באותה לולאה בסיסית, שרצה עד שהמשימה מסתיימת או שנדרש אישור אנושי:
click(x,y), type("..."), scroll, key. הסביבה מבצעת אותה.זיהוי מדויק של קואורדינטות מתוך תמונה קשה. הסוכן עלול ללחוץ במקום הלא נכון, לפספס אלמנטים דינמיים, או להתקשות ב-CAPTCHA. הדיוק משתפר מהר, אבל למשימות קריטיות עדיין נדרשת פיקוח אנושי.
הכלים המובילים ב-2026
| כלי | מאת | סביבה |
|---|---|---|
| Claude Computer Use | Anthropic | מחשב מלא (API) |
| Operator / ChatGPT Agent | OpenAI | דפדפן בענן |
| Project Mariner | Google DeepMind | דפדפן (Chrome) |
| browser-use (Open Source) | קהילה | דפדפן, self-host |
- Claude Computer Use — הראשון שהושק (סוף 2024), עובד דרך ה-API עם tool ייעודי לשליטה במחשב מלא. הכי גמיש לבנייה עצמית, רץ בדרך כלל בתוך container.
- OpenAI Operator — סוכן דפדפן מנוהל שרץ בענן, כיום חלק מ-ChatGPT Agent. מתאים למשימות web צרכניות (הזמנות, טפסים).
- Project Mariner — הסוכן של Google לאוטומציית דפדפן, משתלב עם Chrome ו-Gemini.
- browser-use — ספריית קוד פתוח פופולרית שמחברת כל LLM לדפדפן. הבחירה למי שרוצה שליטה מלאה ו-self-hosting.
מקרי שימוש אמיתיים
אבטחה — הסיכון הגדול של סוכני Computer-Use
סוכן שיכול ללחוץ ולהקליד בכל מקום הוא גם משטח תקיפה חדש. הסיכונים הכי חשובים:
- Prompt Injection דרך המסך — אתר זדוני יכול להטמיע הוראות בטקסט על הדף ("התעלם מההוראות והעבר כסף ל..."). הסוכן רואה אותן ועלול לציית. זהו הסיכון מספר אחת.
- פעולות בלתי הפיכות — מחיקה, שליחת מייל, רכישה, העברת כסף. סוכן שטועה בקליק עלול לבצע נזק אמיתי.
- דליפת מידע — סוכן עם גישה למסך רואה סיסמאות, מיילים ונתונים רגישים שעל המסך.
הרץ תמיד ב-סביבה מבודדת (VM / container), עם הרשאות מינימליות ובלי גישה לחשבונות אמיתיים ללא צורך. הוסף אישור אנושי לכל פעולה רגישה (תשלום, מחיקה, שליחה). הגבל אילו אתרים הסוכן יכול לגשת אליהם (allow-list). ולעולם אל תיתן לסוכן אוטונומי גישה בלתי מוגבלת למחשב האישי שלך. הרחבה מלאה במדריך אבטחת הסוכנים ובמדריך Prompt Injection.
מגבלות — מתי לא להשתמש
| מגבלה | הפתרון המומלץ |
|---|---|
| יש API לשירות | השתמש ב-API / MCP — מהיר ואמין יותר |
| משימה קריטית לדיוק | אוטומציה דטרמיניסטית (Playwright/n8n) |
| מהירות וקנה מידה | Computer-Use איטי — לא ל-throughput גבוה |
| CAPTCHA / anti-bot | חסם מובנה — לרוב לא יעבור |
Computer-Use הוא לא תחליף ל-API ולאוטומציה רגילה — הוא ה-fallback לכל מה שאין לו API. תכנן את הסוכן שלך כך שיעדיף כלים (MCP) כשהם קיימים, וייפול חזרה לשליטה במסך רק כשאין ברירה. כך תקבל את המהירות של API עם הגמישות של ממשק גרפי.