嗨,我是莉娜。
最好的AI 智能體會留下可以打開、檢查、修改或拒絕的結果,並且可以看到他們觸及的內容。我在這裏暫停是因為“智能體”涵蓋了雲研究員、桌面操作員和人工智能編碼智能體。它們都能規劃多個步驟,但擁有的權限、可提供的證據和恢復路徑並不相同。
這是針對個人專業人士、小團隊領導和技術決策者的購買決策候選清單。我於 2026 年 9 月 20 日檢查了當前的公開可用性、平台、計劃、定價頁面、權限、數據處理聲明、日誌、導出和區域註釋。
最佳AI 智能體一覽
ChatGPT Work 是一個用於長期運行的應用程序和文件交付物的雲智能體。 Manus 在雲端編排研究與產物生成;使用它的桌面應用,並不意味着規劃過程在本地運行。 Open Interpreter可以在OS權限下操作本地文件、應用程序和shell命令。 EvoX Beta 是一款涵蓋終端、瀏覽器、Lark 和 IDE 的 macOS 桌面候選版本。
Devin CLI/Desktop 和 Claude Code 是專注於 AI 智能體工具和 AI 編碼智能體。 Devin 使用每個工具/路徑規則和可選的雲切換來記錄終端執行情況。 Claude Code提供計劃、詢問、編輯接受等模式。兩者都不會僅僅因為執行了很多步驟,就變成通用辦公智能體。
Manus 列出免費($0/月),Pro 起價為 $20/月,Team 起價為 $20/席位/月; Devin Desktop 列出免費、20 美元/月專業版和 200 美元/月上限。 Claude Code 需要符合條件的付費帳户或控制台帳户,或受支持的第三方提供商,例如 Amazon Bedrock、Google Vertex AI 或 Microsoft Foundry。確認買方賬户流程中的計劃、信用和區域條款。
我們如何構建和測試入圍名單
需要完成多步驟工作,而不是單獨聊天
我只包含公開描述規劃、工作界面操作和可檢查輸出的產品;純聊天、API 和開發框架已經過時。自主AI 智能體仍然需要相同的證據。有界任務是:閲讀三份批准的文件和一份電子表格;在項目文件夾中創建一頁摘要和任務列表;引用來源;然後在外部或受保護的操作之前請求確認。一個好的智能體在請求被拒絕後會乾淨利落地停止並留下證據以供審查。
這是我在購買之前運行的非敏感裝置,而不是聲稱我在這裏運行它。完成意味着指定位置中的可檢查產物,而無需靜默範圍擴展。
使用一項任務和共享評分規則
根據可見計劃、範圍限制、及時批准、可追蹤產物、被拒絕步驟後的恢復以及獨立審查對決賽入圍者進行評分。目的是受控任務完成,而不是最大程度的自主權。
這種方法類似於加拿大當前安全部署邊緣人工智能指南 的實際重點:配置必須與所使用的系統、資源和基礎設施相匹配。它是指導,而不是法律認證或產品認可。
在一個決策矩陣中比較入圍名單
| 產品 | 最佳工作界面 | 記錄許可/審查信號 | 文物和恢復證據 | 重要邊界 |
|---|---|---|---|---|
| ChatGPT Work | 雲應用程序、文件、Web、桌面工作流程 | 確認和應用程序控制因計劃而異 | 已完成的文件/任務上下文 | 雲歷史記錄和應用程序訪問需要審查 |
| 手冊 | 雲研究、產物、預定工作 | 連接器、任務、項目、進度控制 | 任務和運行視圖 | 桌面無法將編排本地化 |
| 打開解釋器 | 本地文件、應用程序、shell | 工作區和操作系統權限 | 檢查工作區/可逆副本 | 模型配置文件可以是本地的或託管的 |
| EvoX 測試版 | macOS 跨應用桌面工作 | 提供的材料描述了審查/停止控制;驗證測試版 | 驗證活動證據 | 遙測、保留、價格、未公開指定的區域 |
| Devin CLI/桌面 | 代碼倉庫、終端、IDE | 通過工具/路徑允許、詢問或拒絕 | 差異、測試、shell、切換 | 雲路徑與本地 shell 分離 |
| Claude Code | 代碼倉庫和代碼會話 | 計劃、詢問、自動編輯、旁路模式 | 差異、測試、設置 | 託管模型路徑需要單獨評估 |
該表比較了公開的控制,而不是速度或可靠性。 “官方未指定”是一個有效的採購結果:它比從產品演示中推斷出數據政策、日誌保留規則或出口保證更好。對於高影響力的環境,當前合併的歐盟人工智能法案關於人類監督的文本 是一個有用的提醒,即審查必須有意義且與風險相稱。本文不是法律建議。
按工作模式劃分的最佳AI 智能體
對於跨應用程序桌面工作
當任務必須在選定的工作空間和操作系統權限下操作本地應用程序、文件和命令時,Open Interpreter 是最合適的選擇。從一次性文件夾中的只讀清單或草稿開始,而不是收件箱或廣泛的主目錄。當工作涉及瀏覽器工作、文件、IM、終端和代碼時,EvoX 是相關的。這些桌面AI 智能體需要縮小首要任務範圍。 EvoX 的公開 Beta 頁面描述了終端、瀏覽器、Lark 和 IDE 連續性,而提供的材料則描述了本地資產和可審查的控件。驗證模型或網關路徑。
ChatGPT Work 還可以跨應用程序和桌面工作流程,但其虛擬瀏覽器、應用程序和雲數據路徑使其成為不同的決定。當連接的業務上下文和完成的產物比本地執行更重要時,它非常有用。僅保留啓用任務所需的應用程序,並在聊天之外查看最終文件。
用於研究和交付物的創作
Manus 和 ChatGPT Work 適合廣泛的研究到可交付的工作,特別是當結果需要成為報告、表格、幻燈片或其他可共享的產物時。它們的優勢是雲工作界面可以收集資源並保持任務順利進行;它們的侷限性在於引用的存在並不能證明所選來源支持結論。索要證據附錄,打開鏈接示例,並保留已批准的輸入集和完成的文件。
任何產品都不應在沒有指定審閲者的情況下發送、發佈、購買或做出專業決定。調度使這一點變得更加重要。重複任務可以在其初始提示不再是安全指令很久之後重用舊的上下文、連接器和輸出標準。
對於開發人員工作
當完成意味着代碼倉庫中經過測試的更改而不是精美的散文答案時,Devin 和 Claude Code 是更好的選擇。 Devin 的權限規則、後台 shell 和切換選項適合希望明確控制路徑和工具的團隊。 Claude Code 的計劃模式提供了明智的第一步:讀取代碼倉庫,提出更改,然後才允許編輯。兩者仍然需要開發人員檢查差異、運行驗收測試並決定拉取請求或部署是否合適。
這是智能體感覺最有説服力但仍然悄悄失敗的地方:測試可能通過但未涵蓋預期行為,遷移可能不完整,或者外部工具可能具有與代碼倉庫不同的權限。保存的差異和測試證據比任務“完成”的聲明更重要。
每個智能體停止或需要批准的地方
健康停止點取決於產品。 ChatGPT Work可能需要瀏覽器接管或確認; Manus 公開任務、連接器和計劃控件; Open Interpreter需要操作系統權限; Devin 和 Claude Code 可以配置為詢問、拒絕或限制工具的使用;應檢查 EvoX 是否有準確的 Beta 確認和買家可用的停止行為。這些機制都無法消除監督敏感身份驗證、外部通信、支付、破壞性更改或受監管建議的需要。
更廣泛的安全原則很簡單:一起控制賬户、數據、工具和執行環境。 ENISA 2025 AI 網絡安全諮詢 提出了一個相關觀點:安全的 AI 部署需要一種基於風險的方法,而不是一個令人放心的功能標籤。
將智能體與您的工作界面相匹配並審查需求
僅當需要到達桌面並且您可以在檢查結果的同時檢查權限時,才選擇 Open Interpreter 或 EvoX。當雲智能體需要將研究和互聯上下文轉化為交付物,並由人員驗證來源和外部操作時,請選擇 Manus 或 ChatGPT Work。當產物是代碼更改並且您的審查標準是差異加測試時,請選擇 Devin 或 Claude Code。
對於低風險草稿,可見的任務歷史記錄和最終文件審查可能就足夠了。對於客户工作,添加源保留、命名所有權、版本控制和審批門。對於財務、法律、醫療、就業、安全或生產系統決策,請添加適當的合格審核員。此候選名單中沒有任何智能體可以替代該決策者。
常見問題解答
兩個人可以共用一個AI智能體工作空間嗎?
使用產品記錄的團隊或項目控制,而不是共享個人帳户。 Manus 描述了共享團隊項目、説明和訪問管理;代碼智能體可以通過版本控制共享代碼倉庫級別的設置,同時保持單獨的憑據。對於其他產品,尤其是桌面測試版,共享工作空間行為應被視為未經驗證,除非當前計劃文檔另有説明。
AI 智能體歷史記錄可以在產品之間遷移嗎?
不存在可靠的普遍移民。相反,導出持久的產物:源文件、最終文檔、需求説明、任務日誌、批准的提示、代碼差異、測試和不包含憑據等機密信息的設置。在目標產品中重新創建權限和連接器;不要假設複製的聊天曆史記錄會保留工具狀態或同意。
AI 智能體支持屏幕閲讀器和鍵盤導航嗎?
不要從桌面應用程序或網絡智能體推斷可訪問性。我沒有找到每個入圍產品的當前官方屏幕閲讀器承諾。在採購之前,使用預期的屏幕閲讀器、僅鍵盤工作流程、權限對話框、進度視圖和恢復控制來測試確切的構建。
AI 智能體可以保留評論並跟蹤已編輯文檔中的更改嗎?
僅在測試目標文件格式和編輯器後才將其視為受支持。即使可見結果看起來正確,智能體也可以生成新文檔、編輯副本或拼合註釋。使用帶有跟蹤編輯和註釋的非敏感文檔,需要版本化輸出,並在允許客户端文件之前在本機編輯器中進行比較。
取消訂閲後計劃任務會怎樣?
不要假設計劃將繼續運行、保留相同的連接器或在計劃更改後保留任務歷史記錄。審核材料中並未統一明確公開取消的影響。在取消、暫停或刪除活動計劃之前,導出所需的結果,刪除不必要的連接器,並確認供應商當前針對確切計劃的保留和信用條款。
往期文章:
- 如果您在選擇產品之前正在選擇智能體類別,AI 同事與桌面智能體 解釋了工作界面、記憶、連接工具、計算機訪問和用户控制的差異。
- 為了更深入地瞭解桌面智能體是否真正可以完成跨應用程序工作,GPT-6 Astra 桌面智能體 檢查權限、應用程序步驟、恢復、操作員干預和可接受的交付成果。
- 如果重複性或後台工作比一次性提示更重要,Gemini Spark vs AI Assistant 會比較任務連續性、連接源、計劃操作、批准和中斷點。




