2026 電腦使用代理人決策指南:Claude、Operator 與開源棧完整比較

如果你過去一年試著自動化任何一條真實的工作流,你大概撞過同一面牆:你需要的工具沒有 API,或者那個 API 只開放了人類能點擊到 30% 的功能。過去十年大家靠 Selenium、Playwright 或 RPA 撐過去,但這些工具有同一個致命傷:設計師改版的那一刻,所有腳本一起死。

電腦使用代理人(Computer Use Agents)是第一個真正可信的替代方案。它們看畫面、理解上下文、然後動手。到了 2026 年底,這已經不是研究展示:Anthropic 的 Claude Computer Use、OpenAI 的 Operator 與 ChatGPT agent mode、Google 在 Gemini 裡的 Project Mariner,加上由 Stagehand、browser-use、Browser MCP 領頭的開源浪潮,全部進入生產環境。現在的問題不再是這到底行不行,而是哪一個才適合你的任務。

這是一份決策指南,不是吹捧文。基準分數很混雜、失敗模式很真實,而且選錯工具會讓你在一個五行程式就能解決的任務上燒光 token。下面的建議,是依據「工作負載」而不是「品牌 logo」來挑選。

2026 年底的電腦使用代理人現況

十八個月前,所謂的電腦使用還只是研究團隊錄下模型笨拙地拖著滑鼠戳計算機的畫面。這一類技術後來分成兩個常被混為一談的陣營。

  • 全桌面代理人可以驅動機器上任何應用程式:終端機、檔案總管、IDE、原生 App、瀏覽器。能真正擁有這個範圍的主流商業產品,目前只有 Claude Computer Use。
  • 僅瀏覽器代理人範圍限制在一個 Chromium 工作階段。沙箱化更簡單、速度更快、單位任務成本更低,但碰不到分頁以外的任何東西。Operator、ChatGPT agent mode、Project Mariner、browser-use、Stagehand 都屬於這一類。

兩者的技術迴圈一模一樣。代理人截圖,把圖丟給視覺語言模型,接收一個動作(在座標 x, y 點擊、輸入文字、按鍵),執行,再截圖。直到任務結束或 token 預算燒光。這個迴圈同時也是大多數成本與大多數失敗發生的地方。

基準分數的真相

各家產品頁都會挑自己領先的基準來宣傳。以下是 2026 年第四季公開數據的真實樣貌,涵蓋 OSWorld-Verified、WebVoyager,以及幾家實驗室開始公布的軟體工程子集。

工作負載 最佳選擇 原因 大約分數
純網頁導航、表單填寫、購物 OpenAI Operator / ChatGPT agent mode 最強的純瀏覽器棧,Human-in-the-loop 做得好 瀏覽器成功率約 87%
混合真實桌面任務(OSWorld) OpenAI Operator 在跨 App 混合項目中領先 OSWorld 約 69.9%
全桌面、跨作業系統 Claude Computer Use 截圖加滑鼠鍵盤,沒有 OS 綁定 OSWorld 約 62.9%
軟體工程工作流 Claude Computer Use 同時驅動終端、瀏覽器、本機檔案 程式設計任務約 49%
在 Google Workspace 內 Project Mariner(Gemini) 深度整合,進步快速 落後領導者,但在追
由你掌控的生產級瀏覽器自動化 Stagehand Playwright 加 AI 選擇器,有確定性退路 視所選模型而異
便宜、用自己模型的瀏覽器代理人 browser-use BYOM、MIT 授權、LangChain 友善 視模型而異
給現有代理人用的可組合瀏覽器工具 Browser MCP 跨 MCP 主機的標準化工具介面 視主機而異

有兩個數字值得停下來想一想。OSWorld 的 69.9% 成功率聽起來不錯,但算一下就知道:大約三個任務就有一個會失敗。而且最強與最弱之間的差距小到一個程度,「按工作形狀選」會比「按排行榜選」更可靠。排行榜每季都在變。

同時也該對天花板保持清醒。上面那些基準獎勵的,是細心的人類能完成的任務。一旦工作流裡出現驗證碼、需要打電話的客服、或是要 hover 600 毫秒才會展開的隱藏手風琴選單,分數就會崩。把基準分數當作有用的地板,而非保證的生產線成功率。

Claude Computer Use:當任務跨越整個桌面

Claude 的實作刻意保持可攜性。你只要開放一個 computer_20250124 工具,接受滑鼠鍵盤動作與螢幕矩形,模型就會驅動螢幕上看到的一切。沒有作業系統 hook、沒有 accessibility API、沒有每個 App 客製化的黏合層。這種通用性本身就是它的設計哲學,也讓 Claude 成為跨應用工作流唯一的主流選擇。

經典例子:從 Finder 裡的 PDF 抓一個數字、貼到試算表、再用桌面郵件軟體寄出檔案。任何純瀏覽器代理人都做不到,Claude 做得到。代價是延遲:每一步都要等截圖來回,所以一個有很多小點擊的工作流會感覺很慢,每個動作大約兩到五秒;還有安全範圍的問題。Anthropic 自己的文件講得很直白:在沙箱化 VM 或容器裡跑,絕對不要放在你日常用的主機上。

實務上,延遲是團隊後來悄悄把 Claude 換成純瀏覽器工具最常見的原因,因為他們發現任務其實裝得進一個分頁。如果你的工作流可以寫成「打開這個網址、填這些欄位、按送出」,你不需要 Claude,你需要 Operator。Claude 的價值,是當工作流真的無法化約成瀏覽器時才浮現。

最佳場景:跨應用工作流、沒有 API 的舊系統、需要終端加瀏覽器加檔案系統同時進行的軟體工程任務。

跳過它的時機:任務純粹是網頁型、需要次秒級延遲、或你無法保證沙箱化。

OpenAI Operator 與 ChatGPT Agent Mode:網頁專家

Operator 的任務範圍比較窄,但執行得很好。它跑在 OpenAI 基礎設施上一個隔離的 Chromium 瀏覽器裡,代表沒有本機檔案存取、不會意外洩漏憑證、有一條清楚的安全邊界。你用自然語言描述任務,Operator 就會去導航、填表、抓資料。碰到敏感輸入(密碼、付款資料)它會停下來要你確認,這個小設計選擇比聽起來重要。

ChatGPT agent mode 是後繼產品,Plus 與 Team 訂閱戶可用。它把 Operator 的瀏覽器技能和更深的工具使用(包含程式碼執行與文件編輯)混在一起,並繼承同一個沙箱。在 WebVoyager 上,這條產品線以約 87% 居於業界領先。

代價是僵化的範圍。如果你的任務碰到瀏覽器分頁以外的東西 — 原生 App、本機檔案、桌面終端 — 你從這裡走不過去。還有另一個很少被提到的代價:Operator 跑在 OpenAI 的基礎設施上,代表你的瀏覽活動是被第三方處理的。對大多數消費級任務這沒問題,但對涉及受管制資料或機密併購研究的工作,如果沒有明確的資料處理合約,基本上出局。

最佳場景:網路研究、比價抓資料、訂機票、填表,任何完全在分頁內、又受益於人工確認閘門的工作。

跳過它的時機:任務跨應用、需要可重現的腳本、或你的資料落地規範禁止資料跑到別人家的基礎設施上。

Gemini 與 Project Mariner:Workspace 的捷徑

Google 的入場是三大廠裡最安靜的,但如果你的團隊本來就活在 Workspace 裡,它就很重要。Project Mariner 透過 Gemini 2.5 操控瀏覽器,並與 Gmail、Drive、Calendar、Docs 深度整合。如果你的工作流是「摘要這些信件、草擬回覆、把相關日期加到行事曆」,Mariner 是阻力最小的路。

離開 Google 生態系,價值主張就變薄了。Mariner 的原始基準分數落後 Operator 與 Claude,沙箱化與成本的公開文件也比較少。把它視為 Workspace 使用者的預設,而不是通用首選。

有一件事值得注意:Google 是分批推出 Mariner,功能被切進不同的 Workspace 方案,而且部分只在美國上線。如果你在規劃全球部署,請先確認所在地區的可用性與功能對等,再決定是否押注。

開源浪潮:Stagehand、browser-use、Browser MCP

2026 年最被低估的進展,是你不再需要旗艦產品就能交付具代理能力的瀏覽器自動化。三個開源工具已經跨進生產級。

Stagehand(Browserbase)

Stagehand 把 Playwright 包上一層 AI,可以用自然語言表達選擇器(「視窗底部那顆藍色的『確認』按鈕」),同時保留 Playwright 的確定性原語作為退路。這種混合設計是它的巧妙之處。模型有把握時就用自然語言動作;沒把握時你可以降級用真正的 CSS 選擇器,工作還是出得去。對生產環境的爬蟲與 QA 來說,這是主力選擇。

import { Stagehand } from "@browserbasehq/stagehand";

const stagehand = new Stagehand({
  model: "anthropic/claude-sonnet-4-20250514",
  env: "BROWSERBASE",
});

await stagehand.init();
const page = await stagehand.context.newPage();
await page.goto("https://example.com/dashboard");

// 自然語言動作
await stagehand.act("click the 'Export to CSV' button");

// 需要時退回確定性寫法
await page.click('[data-testid="export-csv"]');

await stagehand.close();

Stagehand 真正讓它感覺像 SaaS 產品的,是 Browserbase 提供的託管執行環境。你拿到的是遠端瀏覽器、session 錄影、開箱即用的反偵測機制。如果你想自己跑 Chromium,開源核心同樣可以接本地瀏覽器。

browser-use

browser-use 是 Python 原生、MIT 授權的選項。帶你自己的模型,指向一個 Chromium 執行個體,五十行內你就有了一個可控的瀏覽器代理人。它與 LangChain、LlamaIndex 接得很乾淨,是原型工作與想要完全掌握模型選擇的團隊的預設選項。

from browser_use import Agent
from langchain_anthropic import ChatAnthropic

agent = Agent(
    task="找出 11 月 14 日從 SFO 直飛 JFK 最便宜的航班",
    llm=ChatAnthropic(model="claude-sonnet-4-20250514"),
)

history = await agent.run()
print(history.final_result())

browser-use 周圍的社群生態是值得關注的資產。這個 repo 累積了上百個小整合 — 驗證碼解算、代理輪換、自訂 DOM 觀察器 — 你可以直接組合進來,不用自己刻管線。它是開源世界最接近「預設代理化瀏覽器函式庫」的東西。

Browser MCP

Browser MCP 把一個可控的瀏覽器當作工具介面,開放給任何相容 MCP 的代理人。它的賣點是可組合性:如果你本來就在 Claude Desktop、Cursor 或任何 MCP 主機上跑代理人,你不用寫客製整合就能交給它一個瀏覽器工具。代價是效能 — MCP 伺服器多了一跳,而以截圖為主的迴圈並不便宜。對輕量的檢查任務它很優秀;對高吞吐的爬蟲,還是回到 Stagehand 或 browser-use。

什麼時候電腦使用代理人是好選擇 — 什麼時候不是

2026 年最浪費錢的方式,是在不需要它的時候硬上。以下是一些誠實的界線。

適合的情境

  • 該網站沒有 API,或 API 必須通過業務窗口才能取得。
  • 任務深度是一到十個動作,而且有清楚的成功條件。
  • 介面穩定到一個普通人可以在五分鐘內完成。
  • 你能接受在破壞性步驟上設人工確認閘門。
  • 量小到不值得為了它做正式的 API 整合。

不適合的情境

  • 你在處理上千筆類似紀錄 — 一支接好 API 的腳本會便宜十倍到一百倍。
  • 介面每天都在變,或依賴 CAPTCHA 這類視覺線索,任何誠實的代理人都會拒絕解。
  • 你需要稽核等級的可靠性。今天即使是最佳操作者,在簡單瀏覽器任務也只有 87%,混合桌面工作更不到 70%。
  • 資料受法規管轄,沒有嚴格的沙箱合約就不能離開你的基礎設施。
  • 任務簡單到一條 IFTTT 或 Zapier 食譜就能搞定。

常見錯誤

過去六個月我看過四個生產團隊犯同一組錯,沒有一個是冷門的坑,全是那種最明顯、被重複犯的錯。

  1. 讓代理人直接跑在工程師的筆電上。截圖迴圈看得到一切:別的分頁裡的密碼、機密的 Slack 頻道、對錯視窗的誤點。永遠沙箱化。
  2. 跳過確認閘門。70% 成功率代表代理人偶爾會對錯的對話框按下「確認」。一次錯誤確認的代價,足以抵銷自動化的所有節省。
  3. 忘記 token 經濟學。每個動作都會重傳截圖加上不斷增長的上下文。一個複雜任務可能輕鬆燒掉一百萬 token。為每個任務設定支出上限,否則月底帳單會給你驚喜。
  4. 把代理人當人看。它解不了驗證碼、打不進客服電話、也讀不懂螢幕沒顯示的上下文。為人工接手做好規劃。
  5. 用品牌挑,而不是用工作負載挑。任務是網頁型還是桌面型,會直接翻轉正確選擇。讀完基準,再針對你的任務類型讀一次。
  6. 略過可觀測性。沒有截圖日誌、沒有每一步指標,你就分不清失敗是模型選錯、頁面改版,還是網路抖動。你會在黑暗中除錯。

必須先想清楚的成本與 token 經濟學

讓大多數團隊驚訝的那一行帳,是 token 成本而不是授權費。每個動作都會重傳一張截圖加上執行中的上下文,截圖的 token 量加起來很可觀。一張 1920×1080 的 PNG 經過視覺前處理後,動輒吃掉 1,500 到 2,500 個輸入 token;多數任務會跑十到五十個步驟。也就是說,一個任務消耗的量等同一份長文件好幾份的份量。

三個槓桿真的能改變結果。

  • 小一點的截圖。用 1024×768 而非 1920×1080。多數電腦使用 API 讓你挑顯示尺寸,而且很多模型現在本來就會內部降解析。
  • 提示快取。特別是 Claude 的 prompt caching,可以在長代理人迴圈裡把重複的系統提示成本砍掉一個量級。如果你的供應商有提供,請打開。
  • 步數預算。為每個任務設定動作上限。如果三十步內還沒完成,就轉給真人。

一個粗略的經驗法則:Operator 上簡單的網頁任務抓五到十五美分;Claude 上複雜的多 App 工作流抓兩到八美元。這些是量級估計,不是報價。你的實際成本取決於截圖密度、模型選擇,以及代理人多久會脫軌、必須重試一次。

提示注入:沒人第一個處理的風險

電腦使用是第一個讓「提示注入」變得有物理危險性的代理人類別。一個網頁可以把指令藏進圖片、alt 文字、白底白字、隱藏的 DOM 節點,甚至網址列。代理人讀頁面的方式跟人類一樣,而人類是會被夠巧的頁面騙到的。模型也是。

2026 年實務上的防禦有限,但真的有用。

  • 把頁面內容當不可信任輸入。絕對不要讓網頁內容直接寫入系統提示,也不要讓它寫入控制 shell 指令、刪除檔案、付款的工具參數。
  • 隔離瀏覽器。代理人只需要瀏覽器時,不要給它檔案系統;需要檔案系統時,給它一個暫存目錄就好。
  • 在「意圖」上確認,而不是在「動作」上確認。當代理人說「我準備要送出表單」,先跟人確認表單內容,再點送出。等點完再確認已經來不及。
  • 記錄與回放。每一張截圖、每一個動作、每一筆模型呼叫。當怪事發生,你會想要這些畫面。

這些都不是銀彈。研究人員已經在實驗環境展示過能繞過這些防禦的間接提示注入攻擊。誠實的答案是:電腦使用的安全是個持續移動的目標,而能在生產環境撐下來的團隊,是把它當活的問題在處理,而不是當核對清單。

實用決策檢查清單

在註冊任何服務之前,跑一遍這個清單。

  • 任務完全在瀏覽器分頁內嗎?如果是,從 Operator 或 Stagehand 開始。
  • 任務需要終端、檔案系統或原生 App 嗎?如果是,用 Claude Computer Use 並放在 VM 裡。
  • 工作場景在 Google Workspace 嗎?如果是,用 Project Mariner。
  • 你需要完全掌握模型與成本嗎?如果是,用 browser-use 或 Stagehand 配自己的 API key。
  • 你在替現有的 MCP 代理人加瀏覽器能力嗎?如果是,用 Browser MCP。
  • 量大到一個真正的 API 反而更便宜嗎?如果是,停下來,改寫或購買 API 整合。
  • 你能接受三次失敗一次嗎?如果不能,就不要在沒有人監督的情況下出貨。

怎麼不燒起來地導入一套

如果決定要上線,下面這個導入模式在生產環境真正撐得住。

  1. 從沙箱開始。全桌面代理人在 2026 年的預設是 Firecracker microVM;純瀏覽器代理人的話,一個隔離的 Chromium 容器就夠。不要為了省一天而跳過這步。
  2. 白名單動作。把破壞性動詞(刪除、付款、提交、寄送)全部擋在人工確認之後。唯讀與導航預設為安全。
  3. 全部記錄。每一張截圖、每一個動作、每一筆 token。事後檢討的時候你會需要。
  4. 為每個任務設定支出上限。設一個硬性的 token 上限。超過就停,轉給真人。
  5. 量測實際成功率。你的任務組合不會等於基準。追蹤三十天的真實結果,再相信數字。
  6. 建立接手路徑。當代理人失敗時,它應該把畫面交回給人類,並附上清楚的嘗試摘要,而不是消失在 log 裡。

常見問題

2026 年哪一個電腦使用代理人最強?

看任務。OpenAI Operator 與 ChatGPT agent mode 在純網頁導航領先,大約 87% 瀏覽器成功率。Claude Computer Use 在全桌面與軟體工程工作流領先,程式設計任務約 49%,因為它能同時驅動終端與本機檔案。讓代理人對上工作負載。

可以讓電腦使用代理人無人監督地跑嗎?

現在還不安全。即使最強的桌面代理人在混合任務也只有 62% 到 70% 的成功率,代表大約三個任務就有一個失敗。配上滑鼠鍵盤控制權,失敗時真的會造成實質損害。永遠跑在沙箱裡,並把破壞性動作擋在人工確認後面。

Stagehand 或 browser-use 這類開源工具已經可以上生產了嗎?

在純瀏覽器的工作流上,是的。當你需要 AI 選擇器加上確定性 Playwright 退路時,Stagehand 是最強選擇。當你想配自己的模型並接 LangChain 或 LlamaIndex 時,browser-use 是最靈活的。

這些代理人跑起來成本多少?

差異很大。一個簡單的網頁任務可能只要幾美分。一個複雜的多 App 工作流跑 Claude 可能落在個位數美元,因為每個動作都重傳截圖加上不斷增長的上下文。為每個任務設支出上限並監控 token 使用;沒在管的團隊常常被帳單偷襲。

安全性與提示注入呢?

電腦使用放大了平常代理人就有的資安風險。一個惡意網頁可以把指令藏在圖片、alt 文字或頁面本身,代理人可能照做。把任何網頁內容都當作不可信任輸入,嚴格限制代理人權限,並把每個動作都記錄下來供審查。

最後一句

電腦使用代理人是真實的,進步很快,值得放進你的工具箱。它們失敗的頻率高到不該無人看管。按任務形狀挑:網頁用 Operator 或 ChatGPT agent mode,全桌面用 Claude,Workspace 用 Mariner,想自己掌握棧就用 Stagehand 與 browser-use。全部沙箱化、破壞性動作要確認、開支要設上限。做到這幾件事,你會拿到生產力紅利,而不會在凌晨三點被叫起來滅火。

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *