更强的模型不一定就是可靠的桌面智能体。评估 GPT-6 Astra 桌面智能体时,我会始终记住这一点。OpenAI 将 Astra 描述为计算机操作和端到端专业工作的重大进步,但真正交付成果仍取决于外围运行环境:智能体能看到什么、可以操作哪些应用、如何保留状态、何时需要批准,以及点击失败后怎么办。
我是 Lena。我在这里停下来想了想,因为读模型基准测试时,很容易不知不觉地把成绩归功于整个系统。
针对一项跨应用任务的简短判断
简而言之,GPT-6 Astra 展现出的能力值得开展认真的桌面智能体测试,但“能否完成真正的工作”应在智能体运行框架层面衡量,而不是只看模型名称。
OpenAI 公布了较强的计算机操作成绩,包括厂商报告的 OSWorld 2.0 得分:在延迟模拟中,Astra 约每项任务 40 分钟,得分 72.6%;GPT-5.6 Sol 约每项任务 75 分钟,得分 65.7%。这些数据有参考价值,但仍是 OpenAI 自己的评估,不是对你所用桌面运行环境的独立测试。
对开发者而言,更有价值的问题更具体:固定任务、应用、权限和验收测试后,系统能否在没有隐性人工修补的情况下生成所需交付物?这样的桌面智能体基准更值得信任。
明确桌面任务的交付物
源文件、应用操作与验收测试
我会选择低风险、可复现的跨应用 AI 工作流:提供一份包含小型运营数据集的电子表格,让智能体识别三个有数据支持的趋势,制作五页演示文稿,保存到指定输出目录,再按验收清单检查。
每次运行的输入完全相同。电子表格只读。智能体只能使用表格应用、演示文稿应用和一个可写输出目录。浏览器、邮件、消息应用和云盘均保持禁用。
演示文稿只有在能正常打开、包含五页、准确复现源数据、标明自行计算的内容、不添加无依据的外部结论,并以指定文件名保存时才算通过。这听起来甚至有点枯燥。很好。任务本身一旦变化,桌面智能体测试就很难解释。
Astra 在模型层带来了什么
界面理解、推理与工具选择
模型层负责判断看到了什么、指令意味着什么、下一步该做什么,以及何时需要更多信息。OpenAI 的 GPT-6 Astra 模型文档目前列出了计算机操作、文件搜索、网页搜索、代码解释器、托管 Shell、MCP 等受支持工具。Astra 的上下文窗口为 105 万 token,最多支持 128,000 个输出 token。
当前 API 价格为每百万输入 token 10 美元、每百万缓存输入 token 1 美元、每百万输出 token 50 美元。输入超过 272K token 时,整个请求适用更高价格。因此,长时间的 GPT-6 Astra 计算机操作会话需要关注成本,但 token 单价仍无法告诉你完成一项桌面任务要花多少钱。
Astra 可以判断图表应该放在第三页。运行环境仍必须让该图表可供操作、执行动作、保留文件状态、判断粘贴是否成功,并在演示应用弹出意外对话框时恢复。
我再次回到这个区别,是因为它会改变故障诊断。趋势判断错误可能是推理问题;正确的趋势被粘到错误的页面,则可能是界面状态或运行环境的问题。
桌面智能体运行环境必须提供什么
权限、沙箱、审批与恢复
严肃的运行框架应在执行前明确权限。本测试只允许读取源表格,并且只能写入输出目录。凡是发送数据、修改外部账户、安装软件或访问其他系统的动作,都应禁止或要求批准。
这些智能体运行框架防护措施并非只是面对强大模型时的谨慎做法。OWASP 的智能体 AI 威胁指南将工具调用、身份、权限、记忆和人工监督视为安全的不同组成部分。对桌面智能体开发者来说,关键在于:推理模型变强,不会自动让所有凭据或已连接工具变得更安全。
恢复同样重要。运行环境需要判断操作是否真的完成,保留足够状态以便继续,在限定预算内重试,并在环境偏离预期时安全停止。如果表格应用崩溃后唯一的恢复策略是“一切重来”,系统就没有真正解决长时间运行的问题。
在固定运行框架下测试完成情况
有用的运行记录不只是通过或失败。我会保留源文件校验和、模型 ID、推理设置、启用工具、权限策略、应用版本、开始和结束时间、审批请求、重试、失败步骤,以及最终交付物哈希。
这样,无论 Astra 还是桌面运行环境发生变化,测试都有稳定的参照点。
结果质量与人工干预
最有说服力的结果不是“幻灯片看起来不错”,而是“演示文稿无需人工修改,就满足预先确定的验收测试”。
人工干预应该计入,而不是悄悄从叙述中抹去。如果我必须修正两个数字、移动图表,或告诉智能体它在哪里丢失了进度,这仍可能有使用价值,但不算自主完成。
我没有在这一具体运行框架下独立记录的运行结果,因此不会编造完成率。OpenAI 的公开成绩支持测试 Astra,但不能证明任意基于 Astra 的桌面智能体都能复现这些成绩。
时间、成本与失败步骤恢复
每次运行,我都会记录实际经过时间、模型 token、适用时单独计费的工具活动、重试次数,以及人工干预分钟数。有价值的指标是每个通过验收的交付物的成本,不是原始 token 单价。
如果能避免多次重试,token 更贵的模型也可能让每项已完成任务更便宜;反过来也可能。没有相同的输入、权限、应用和验收测试,“更快”或“更便宜”这样的说法很难审计。
限制与取舍
Astra 的计算机操作能力本身不会创建持久的桌面状态。状态属于更大的智能体系统:文件、应用会话、检查点、权限、任务历史和日志。任务越长,遇到过时界面状态、意外对话框、工具错误和外部变化的机会也越多。
这正是 MITRE ATLAS 智能体调查超越单个产品的参考价值所在。其 2026 年关于智能体系统的工作强调:当智能体能跨操作环境执行动作时,权限边界、受限工具调用、遥测和人在回路的控制非常重要。
还有一条边界需要明确。OpenAI 表示,Astra 使用了更强的监控,在检测到潜在不对齐行为时,能够对部分智能体工作发出警报、暂停或停止。因此,生产运行框架必须把中断视为具有恢复路径的预期状态,而不是异常崩溃。
我的判断仍保留余地:Astra 似乎推进了模型层的能力,但生产质量仍取决于外围系统能否把这些能力转化为可控、可恢复的工作。
常见问题
哪些 ChatGPT 和 API 账户目前能使用 GPT-6 Astra?
截至 2026 年 9 月 8 日,开放仍在逐步推进。OpenAI 表示,由 GPT-6 Astra 驱动的 GPT-6 Pro正在向 ChatGPT 的 Pro 100 美元、Pro 200 美元、Business 和 Enterprise 用户推出;Plus 用户则随账户开放进度,在 ChatGPT Work 和 Codex 中获得 Astra。API 在可用账户中通过 gpt-6-astra 模型调用,不支持 API Free 层级。目前帮助中心将聊天选项称为“GPT-6 Pro, powered by GPT-6 Astra”,而 9 月 3 日发布文章也使用了“GPT-6 Astra Pro”,因此官方来源的命名尚不完全一致。
API 用户能固定使用带日期的 GPT-6 Astra 快照吗?
OpenAI 的 Astra 模型页面描述了快照支持,但在本次评估时,我未在快照列表中看到已公布的带日期 Astra 快照 ID。在 OpenAI 明确公布标识符之前,我不会承诺可以固定日期快照。
截图和文件适用哪些保留控制?
答案取决于所用产品。在 ChatGPT agent 中,截图与会话历史关联,直到会话被删除;OpenAI 表示,已删除的聊天及相关截图会在 90 天内从其系统移除。API 的 Response 默认 store=true,已存储响应数据至少保留 30 天,但有保留例外。非批处理上传文件通常保留到手动删除,批处理文件则在 30 天后过期。零数据保留和企业配置可能改变适用行为,因此不存在覆盖所有部署的统一“Astra 保留期”。
计算机操作轨迹能导出用于审计吗?
Responses API 在响应对象中表示计算机操作,因此 API 开发者可以自行采集并导出执行记录。OpenAI 也为受支持的用户和配置事件提供组织审计日志。我没有找到当前文档声明 ChatGPT 提供开箱即用、涵盖每次计算机操作的完整审计轨迹导出,因此会将这两种能力分开看待。
长时间计算机操作会话适用哪些速率限制?
当前 Astra API 文档列出 Tier 1 为 500 RPM 和 500,000 TPM,最高到 Tier 5 的 15,000 RPM 和 4,000 万 TPM;不支持 Free。长时间会话还受工具行为、应用延迟和重试策略影响,所以模型限额本身不能定义实际会话容量。
对我而言,这才是理解 GPT-6 Astra 桌面智能体的有效方式:它不是替代状态、权限、恢复或监督的模型,而是系统中更强的推理与计算机操作层。我会从“表格到演示文稿”任务开始,保持狭窄权限边界,保留每次运行的所有产物,并在扩大范围前比较通过验收的交付物。
这是今天的观察,还不是定论。
往期文章:
- 在评估 Astra 前先了解桌面智能体这一类别:AI 同事与桌面智能体解释了角色承诺、计算机访问、记忆和用户控制在实际工作中的区别。
- 关于 GPT-6 Astra 外围的系统层,AI 智能体架构:工具、记忆与规划梳理了模型、工具、记忆、规划、权限与恢复如何协作。
- 如果你想在运行框架层而非模型名称层测试 Astra,AI 智能体运行框架工程解释了可靠智能体为何需要受控运行环境、评估循环和可观测执行。
- 关于计算机操作工作流的安全,AI 智能体行为约束说明了桌面智能体为何在接触文件、应用、浏览器或外部系统前需要明确边界。
- 为让 Astra 桌面智能体测试可复现、可审计,LLM 智能体的确定性重放解释了工具调用、状态变化、审批、失败和最终交付物周围应保留哪些记录。



