比起「模型又聪明了多少」,9 月 3 日 OpenAI 发布的 GPT-6 Astra 更值得关注的信号是:AI 正在走出聊天框,开始操作软件、调用工具、跑完一整套工作流。它被定位为面向复杂端到端工作的旗舰模型——对话只是其能力的一部分,真正的变量在于「执行」。
一、Astra 是什么:把推理、代码、视觉、电脑操作串进一条执行链
早期测试者已经展示了 Astra 通过工具或 MCP 操作 Blender、Unreal Engine 5、Ableton Live 等专业软件的案例。开发者 Pietro Schirano 让 Astra 先在 Blender 中制作一台 3D iPod,再封装成 Mac 应用,还原点击滚轮与菜单交互,最终用于浏览 Codex 任务——从发出指令到可运行版本出现,约 15 分钟。该时间并非第三方标准化测评,但案例的意义在于:模型一次性完成了 3D 资产、界面设计、交互逻辑与外部数据连接。
OpenAI 的演示中,Astra 还能根据视觉参考生成 3D 资产,并把 Blender 中的房屋转换为 Unreal Engine 5 中的可行走场景。游戏公司 Playco 表示,在相同的原型开发任务中,Astra 所需的人工修正次数较前代模型减少约 50%。这意味着它的能力边界从传统推理,延伸到了电脑界面、三维空间与连续工作流。
二、成绩单:Terminal-Bench 4.0 得分 57.9%
在 OpenAI 公布的 Terminal-Bench 4.0 结果中,GPT-6 Astra 得分 57.9%,高于 GPT-5.6 Sol 的 37.3% 与 Claude Fable 5.1 的 55.8%。在 OpenAI 采用的测试配置下,Astra 的估算单任务 API 成本较 GPT-5.6 Sol 低约 9%。
这组数字传达了两层信息:其一,电脑/终端类长任务仍是当前模型的「硬骨头」,57.9% 远非「通关」;其二,Astra 在把能力边界外推的同时,单位成本并未失控——这对 Agent 落地很关键,因为端到端任务往往意味着海量工具调用。
三、发布节奏与渠道:从机构到全民
Astra 目前率先向少量机构开放,未来几天将陆续覆盖 ChatGPT Plus、Pro、Business 与 Enterprise 用户,并进入 OpenAI API、Microsoft Azure 与 Amazon Bedrock。Pro、Business 与 Enterprise 用户还将获得 Astra Pro 访问权限。
值得注意的工程细节:配套发布的 Responses API 新增异步工具调用(模型在应用运行函数时继续推进)、WebSocket 中途转向(响应进行中可追加指令)、以及异步失配监控(可在安全告警或人工复核时暂停对话)。这些不是锦上添花,而是长任务 Agent 必需的「可中断、可恢复」基础设施。
四、客观看:更强,也更难管
积极面毋庸置疑:端到端能力显著降低了「把多工具拼起来」的工程成本,专业软件的操作门槛被进一步削平,设计与原型工作的迭代速度有望成倍提升。
但隐忧同样真实。Astra 的思路是直接操作软件界面、跳过传统集成,靠「会话治理(session governance)」而非逐一对接来重塑企业自动化——这天然放大了网络安全、透明度与人工监督的张力。对应用开发者而言,异步工具调用、中途转向与安全中断意味着必须重构状态管理、重试机制与用户侧进度上报:一次「被安全策略暂停」的对话,若没有妥善的状态保存,就可能前功尽弃。
结语:Astra 代表了 Agent 从「回答问题」到「执行工作」的关键一跃。但「能跑完」与「可控地跑完」是两件事。企业若准备接入,建议把审批闸门、操作回滚与可观测性一并设计进来,而不是等出了岔子再补。