这次上的是什么

2026 年 9 月 10 日,OpenAI 把 GPT-Live-1 放进了 API。这个模型此前在 7 月已经在 ChatGPT 的语音能力里亮相,这次开放给开发者,定价为前端语音层每分钟 0.05 美元。官方的定位很明确:面向需要实时语音交互的应用与业务流程,包括接电话的智能体——比如餐厅预订与客服。

需要先把计费边界讲清楚,因为它决定了这个价格到底意味着什么。0.05 美元每分钟只覆盖「前端语音层」,也就是听与说的那部分;负责思考、检索与工具调用的后端模型,按所选模型另行计费。截至目前,OpenAI 未给出一个完整语音智能体「每通电话」的算例,也未披露延迟的具体毫秒数,官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

全双工到底改了什么

要理解 GPT-Live-1 的价值,先看它替换掉的那套结构。多数语音智能体目前是把三件事串起来:语音识别、文本模型推理、语音合成。每经过一次交接都要付出时间,对话的节奏也容易在交接处丢失。开发者还得自己处理「用户插话、停顿、改主意」时系统该怎么办。

GPT-Live-1 改用一层处理输入与输出音频,也就是全双工——它可以在还在说话的同时继续听。而更深层的推理与工具调用,被交给一个后端文本模型去完成,官方给出的可选项包括 GPT-6 Astra、Luna、Terra,也支持第三方模型。这样设计的意图是让推理深度、速度与成本可以按任务匹配:订单查询用轻的模型,复杂投诉用重的模型,而对话本身不需要停下来等结果。

它同时把一些原本要自己搭的管道做进了模型:原生提供语音转写与回复文本、关键词偏置、对订单号与邮编这类字母数字内容的识别能力,以及轮次检测——即便不是轮次制,也仍然支持显式的轮次边界。电话场景被明确支持,意味着这个智能体可以直接接起一通电话。

评测数字,以及它们的前提

官方给出的对照有两组。在测试停顿处理、轮次切换、插话与回应等能力的 Full Duplex Bench 上,GPT-Live-1 比 GPT-Realtime-2.1 高出 30 个百分点。另有媒体转述的口径称,其轮次切换延迟从 GPT-Realtime-2.1 的 1.41 秒降到 0.798 秒。在 Tau3 的端到端语音智能体任务测试里,搭配 GPT-6 Astra 中等推理强度时,它的 Pass@1 任务成功率为 86.2%,而 GPT-Realtime-2.1 为 45.7%。

这些数字需要带着前提读。Full Duplex Bench 的差距是官方公布的「提升幅度」而非两端的绝对分数,因此看不到各自从哪里起步;Tau3 的成绩对应的是「GPT-Live-1 加 GPT-6 Astra」这一组合,而 Astra 是 OpenAI 当前定价最高的模型之一,换一个更便宜的后端,拿到的就不是榜上这个结果。此外,所有评测数据均来自 OpenAI 自身,未经独立验证。

价格结构变了:从 Token 到分钟

与它替换的模型放在一起看,这次最实质的变化是计价方式。GPT-Realtime-2.1 按音频 Token 计费,输入每百万 Token 32 美元、输出每百万 Token 64 美元;GPT-Live-1 则按会话时长计费,每分钟 0.05 美元。两者不能直接换算,而这正是重点——开发者现在为「在线上的时间」付费,Token 账单转移到自己选择的后端模型上。

这个结构的好处是可预测性提高:语音层的成本可以直接按时长估算。但代价是总成本变得不透明。仅前端语音层算一笔简单的账,一千小时通话就是 3,000 美元,而这还没算后端模型读进去的任何一个 Token。对高频、短通话的场景,按分钟计费可能更划算;对低频、长对话且推理复杂的场景,后端成本可能才是大头。

客户侧的早期数字

OpenAI 引用了几家早期使用者的反馈。语言学习平台 Speak 表示,在早期评测中,GPT-Live-1 把系统对学习者的误打断次数减少了近 80%,让学习者有更多时间思考再得到回复。Yelp 将其用于自动化的 Host 服务,称电话处理率有所改善。另有一家医疗服务平台的首席技术官表示,团队因此减少了 80% 的代码量、删掉约 2.3 万行代码。需要说明的是,这些数字由相关公司提供,属于立场性表述,宜作为参考而非独立验证。

三项需要写清楚的短板

其一,能力有回退。GPT-Realtime-2.1 支持图像输入(每百万图像 Token 5 美元),GPT-Live-1 不支持,也不接受视频。如果语音智能体需要在通话中看客户发来的照片,这个模型无法单独胜任。其二,延迟缺少官方数字。OpenAI 的论据是「去掉交接环节能降低延迟」,但模型页把速度与性能标为未指定,公告里也没有出现毫秒级数字。其三,0.05 美元每分钟只买前端。OpenAI 没有给出一个完整语音智能体每通电话的成本算例,而这恰恰是采购方真正需要的数字。

竞争格局

这条赛道上,Google 此前推出过 Gemini 3.1 Flash Live,字节跳动在 2026 年初发布过 Seeduplex 语音系统,英伟达也在工具调用方向布局。OpenAI 的差异化在于把语音层与推理层显式解耦,并通过 Presence 项目对接企业部署。这意味着竞争焦点不只在「语音像不像人」,还在「后端能接多少工具、能走多深的企业流程」。

中立思辨

需要辩证看待。其一,按分钟计费降低了语音层的成本不确定性,但也把总成本拆成了两块,采购方需要自己建立「语音层加后端」的合并成本模型,否则容易低估。其二,全双工在体验上确实更接近真人对话,但它的价值高度依赖场景:高频、短交互、需要自然打断的客服场景受益明显,而结构化的查询类任务未必需要。其三,Tau3 的成绩绑定最贵的后端模型,用它来代表「语音智能体能力」有夸大风险。其四,图像输入的回退是一个明确的适用边界,多模态客服场景需要另找方案。其五,客户侧的 80% 与 2.3 万行代码这类数字来自企业自述,缺少统一口径,不宜横向比较。其六,缺少官方延迟数字意味着「更低的延迟」目前仍是论证而非实测,实际部署中的表现需要自行验证。

趋势研判

短期,语音智能体市场会沿着「前端统一、后端可换」的方向收敛,开发者更愿意把语音层当作基础设施采购,而不是自己拼三段链路;中期,如果按分钟计费被广泛接受,语音 Agent 的成本模型会向通信行业靠拢,出现类似「每分钟成本」的行业基准;长期,语音层与推理层的分离会推动一类新的中间件出现——负责在后端模型之间路由、在不同任务上匹配推理深度与成本的调度层。

对准备上语音 Agent 的团队来说,一个务实的做法是先算清三笔账:语音层按分钟的成本、后端模型的推理成本、以及一次失败通话的代价。把这三笔账摆在一起,才知道 0.05 美元每分钟是便宜还是昂贵。