更強的模型不一定就是可靠的桌面智能體。評估 GPT-6 Astra 桌面智能體時,我會始終記住這一點。OpenAI 將 Astra 描述為計算機操作和端到端專業工作的重大進步,但真正交付成果仍取決於外圍運行環境:智能體能看到什麼、可以操作哪些應用、如何保留狀態、何時需要批准,以及點擊失敗後怎麼辦。
我是 Lena。我在這裏停下來想了想,因為讀模型基準測試時,很容易不知不覺地把成績歸功於整個系統。
針對一項跨應用任務的簡短判斷
簡而言之,GPT-6 Astra 展現出的能力值得開展認真的桌面智能體測試,但“能否完成真正的工作”應在智能體運行框架層面衡量,而不是隻看模型名稱。
OpenAI 公佈了較強的計算機操作成績,包括廠商報告的 OSWorld 2.0 得分:在延遲模擬中,Astra 約每項任務 40 分鐘,得分 72.6%;GPT-5.6 Sol 約每項任務 75 分鐘,得分 65.7%。這些數據有參考價值,但仍是 OpenAI 自己的評估,不是對你所用桌面運行環境的獨立測試。
對開發者而言,更有價值的問題更具體:固定任務、應用、權限和驗收測試後,系統能否在沒有隱性人工修補的情況下生成所需交付物?這樣的桌面智能體基準更值得信任。
明確桌面任務的交付物
源文件、應用操作與驗收測試
我會選擇低風險、可復現的跨應用 AI 工作流:提供一份包含小型運營數據集的電子表格,讓智能體識別三個有數據支持的趨勢,製作五頁演示文稿,保存到指定輸出目錄,再按驗收清單檢查。
每次運行的輸入完全相同。電子表格只讀。智能體只能使用表格應用、演示文稿應用和一個可寫輸出目錄。瀏覽器、郵件、消息應用和雲盤均保持禁用。
演示文稿只有在能正常打開、包含五頁、準確復現源數據、標明自行計算的內容、不添加無依據的外部結論,並以指定文件名保存時才算通過。這聽起來甚至有點枯燥。很好。任務本身一旦變化,桌面智能體測試就很難解釋。
Astra 在模型層帶來了什麼
界面理解、推理與工具選擇
模型層負責判斷看到了什麼、指令意味着什麼、下一步該做什麼,以及何時需要更多信息。OpenAI 的 GPT-6 Astra 模型文檔目前列出了計算機操作、文件搜索、網頁搜索、代碼解釋器、託管 Shell、MCP 等受支持工具。Astra 的上下文窗口為 105 萬 token,最多支持 128,000 個輸出 token。
當前 API 價格為每百萬輸入 token 10 美元、每百萬緩存輸入 token 1 美元、每百萬輸出 token 50 美元。輸入超過 272K token 時,整個請求適用更高價格。因此,長時間的 GPT-6 Astra 計算機操作會話需要關注成本,但 token 單價仍無法告訴你完成一項桌面任務要花多少錢。
Astra 可以判斷圖表應該放在第三頁。運行環境仍必須讓該圖表可供操作、執行動作、保留文件狀態、判斷粘貼是否成功,並在演示應用彈出意外對話框時恢復。
我再次回到這個區別,是因為它會改變故障診斷。趨勢判斷錯誤可能是推理問題;正確的趨勢被粘到錯誤的頁面,則可能是界面狀態或運行環境的問題。
桌面智能體運行環境必須提供什麼
權限、沙箱、審批與恢復
嚴肅的運行框架應在執行前明確權限。本測試只允許讀取源表格,並且只能寫入輸出目錄。凡是發送數據、修改外部賬户、安裝軟件或訪問其他系統的動作,都應禁止或要求批准。
這些智能體運行框架防護措施並非只是面對強大模型時的謹慎做法。OWASP 的智能體 AI 威脅指南將工具調用、身份、權限、記憶和人工監督視為安全的不同組成部分。對桌面智能體開發者來説,關鍵在於:推理模型變強,不會自動讓所有憑據或已連接工具變得更安全。
恢復同樣重要。運行環境需要判斷操作是否真的完成,保留足夠狀態以便繼續,在限定預算內重試,並在環境偏離預期時安全停止。如果表格應用崩潰後唯一的恢復策略是“一切重來”,系統就沒有真正解決長時間運行的問題。
在固定運行框架下測試完成情況
有用的運行記錄不只是通過或失敗。我會保留源文件校驗和、模型 ID、推理設置、啓用工具、權限策略、應用版本、開始和結束時間、審批請求、重試、失敗步驟,以及最終交付物哈希。
這樣,無論 Astra 還是桌面運行環境發生變化,測試都有穩定的參照點。
結果質量與人工干預
最有説服力的結果不是“幻燈片看起來不錯”,而是“演示文稿無需人工修改,就滿足預先確定的驗收測試”。
人工干預應該計入,而不是悄悄從敍述中抹去。如果我必須修正兩個數字、移動圖表,或告訴智能體它在哪裏丟失了進度,這仍可能有使用價值,但不算自主完成。
我沒有在這一具體運行框架下獨立記錄的運行結果,因此不會編造完成率。OpenAI 的公開成績支持測試 Astra,但不能證明任意基於 Astra 的桌面智能體都能復現這些成績。
時間、成本與失敗步驟恢復
每次運行,我都會記錄實際經過時間、模型 token、適用時單獨計費的工具活動、重試次數,以及人工干預分鐘數。有價值的指標是每個通過驗收的交付物的成本,不是原始 token 單價。
如果能避免多次重試,token 更貴的模型也可能讓每項已完成任務更便宜;反過來也可能。沒有相同的輸入、權限、應用和驗收測試,“更快”或“更便宜”這樣的説法很難審計。
限制與取捨
Astra 的計算機操作能力本身不會創建持久的桌面狀態。狀態屬於更大的智能體系統:文件、應用會話、檢查點、權限、任務歷史和日誌。任務越長,遇到過時界面狀態、意外對話框、工具錯誤和外部變化的機會也越多。
這正是 MITRE ATLAS 智能體調查超越單個產品的參考價值所在。其 2026 年關於智能體系統的工作強調:當智能體能跨操作環境執行動作時,權限邊界、受限工具調用、遙測和人在迴路的控制非常重要。
還有一條邊界需要明確。OpenAI 表示,Astra 使用了更強的監控,在檢測到潛在不對齊行為時,能夠對部分智能體工作發出警報、暫停或停止。因此,生產運行框架必須把中斷視為具有恢復路徑的預期狀態,而不是異常崩潰。
我的判斷仍保留餘地:Astra 似乎推進了模型層的能力,但生產質量仍取決於外圍系統能否把這些能力轉化為可控、可恢復的工作。
常見問題
哪些 ChatGPT 和 API 賬户目前能使用 GPT-6 Astra?
截至 2026 年 9 月 8 日,開放仍在逐步推進。OpenAI 表示,由 GPT-6 Astra 驅動的 GPT-6 Pro正在向 ChatGPT 的 Pro 100 美元、Pro 200 美元、Business 和 Enterprise 用户推出;Plus 用户則隨賬户開放進度,在 ChatGPT Work 和 Codex 中獲得 Astra。API 在可用賬户中通過 gpt-6-astra 模型調用,不支持 API Free 層級。目前幫助中心將聊天選項稱為“GPT-6 Pro, powered by GPT-6 Astra”,而 9 月 3 日發佈文章也使用了“GPT-6 Astra Pro”,因此官方來源的命名尚不完全一致。
API 用户能固定使用帶日期的 GPT-6 Astra 快照嗎?
OpenAI 的 Astra 模型頁面描述了快照支持,但在本次評估時,我未在快照列表中看到已公佈的帶日期 Astra 快照 ID。在 OpenAI 明確公佈標識符之前,我不會承諾可以固定日期快照。
截圖和文件適用哪些保留控制?
答案取決於所用產品。在 ChatGPT agent 中,截圖與會話歷史關聯,直到會話被刪除;OpenAI 表示,已刪除的聊天及相關截圖會在 90 天內從其系統移除。API 的 Response 默認 store=true,已存儲響應數據至少保留 30 天,但有保留例外。非批處理上傳文件通常保留到手動刪除,批處理文件則在 30 天后過期。零數據保留和企業配置可能改變適用行為,因此不存在覆蓋所有部署的統一“Astra 保留期”。
計算機操作軌跡能導出用於審計嗎?
Responses API 在響應對象中表示計算機操作,因此 API 開發者可以自行採集並導出執行記錄。OpenAI 也為受支持的用户和配置事件提供組織審計日誌。我沒有找到當前文檔聲明 ChatGPT 提供開箱即用、涵蓋每次計算機操作的完整審計軌跡導出,因此會將這兩種能力分開看待。
長時間計算機操作會話適用哪些速率限制?
當前 Astra API 文檔列出 Tier 1 為 500 RPM 和 500,000 TPM,最高到 Tier 5 的 15,000 RPM 和 4,000 萬 TPM;不支持 Free。長時間會話還受工具行為、應用延遲和重試策略影響,所以模型限額本身不能定義實際會話容量。
對我而言,這才是理解 GPT-6 Astra 桌面智能體的有效方式:它不是替代狀態、權限、恢復或監督的模型,而是系統中更強的推理與計算機操作層。我會從“表格到演示文稿”任務開始,保持狹窄權限邊界,保留每次運行的所有產物,並在擴大範圍前比較通過驗收的交付物。
這是今天的觀察,還不是定論。
往期文章:
- 在評估 Astra 前先了解桌面智能體這一類別:AI 同事與桌面智能體解釋了角色承諾、計算機訪問、記憶和用户控制在實際工作中的區別。
- 關於 GPT-6 Astra 外圍的系統層,AI 智能體架構:工具、記憶與規劃梳理了模型、工具、記憶、規劃、權限與恢復如何協作。
- 如果你想在運行框架層而非模型名稱層測試 Astra,AI 智能體運行框架工程解釋了可靠智能體為何需要受控運行環境、評估循環和可觀測執行。
- 關於計算機操作工作流的安全,AI 智能體行為約束説明了桌面智能體為何在接觸文件、應用、瀏覽器或外部系統前需要明確邊界。
- 為讓 Astra 桌面智能體測試可復現、可審計,LLM 智能體的確定性重放解釋了工具調用、狀態變化、審批、失敗和最終交付物周圍應保留哪些記錄。



