🔗 技术协议

OpenAI Realtime API

别名:实时语音 APIWebSocket 语音语音 AgentRTCRealtime
分类🔗 技术协议
阅读时间⏱️ 16 分钟
更新时间📅 2026-07-16
条目编号ENC-PROTOCOL-09-openai-realtime
OpenAI Realtime API 是基于 WebSocket 的低延迟语音/多模态接口,支持语音输入、模型语音输出与中断(barge-in)处理,使 Agent 能以「自然对话」方式与人交互,是语音 Agent 的核心协议。

关键要点 ✦

协议形态

客户端与 OpenAI 之间维持一条 WebSocket 长连接,双方以 JSON 事件(event)通信:session.update 配置参数,input_audio_buffer.append 推入麦克风音频,response.audio.delta 拉取合成语音流。函数调用response.function_call 事件下发,应用执行后回传结果。

语音 Agent 的关键特性

打断(Barge-in):用户可在模型说话时插话,服务端实时检测并中止当前语音输出,实现自然对话。服务端 VAD:自动判断说话起止,免去客户端管理。多模态:除音频外也支持图像输入。

这让构建「电话客服 Agent」「语音助手」无需自研 ASR/TTS 流水线。

落地考量

延迟是生命线:从用户停说到首字节语音的端到端耗时通常需压到数百毫秒内才自然。需关注成本(按音频时长与 token 计费)、隐私(音频经服务端)与降级(网络抖动时的重连与缓冲策略)。

🎯 应用场景

语音客服 Agent
自然语言接听电话,调用业务系统办结业务。
车载/家居助手
全程语音交互,支持随时打断与追问。
语音陪练/教学
外语、面试等场景的实时口语互动。

✅ 最佳实践

  • 设置合理的打断阈值,避免误触发与抢话
  • 对音频与转录做隐私合规与留存策略
  • 设计断线重连与弱网降级路径
  • 监控端到端延迟,设告警保对话自然度

🔮 未来展望

Realtime 协议将向「全双工、超低延迟 + 端侧预处理」演进,并结合情感与语调理解;与 MCP 打通后,语音 Agent 也能像文本 Agent 一样即插即用海量工具。

📖 相关条目

🛠️ 相关产品

🏷️ 标签Realtime API语音WebSocket语音 Agent实时OpenAI