实战 📋 6 个步骤 第 264 / 470 篇

Hermes Agent v0.20 实时语音模式:流式 TTS + 打断 + 本地唤醒词实战

2026 年 8 月 3 日 Hermes Agent v2026.8.3(Herald)发布,约 1400 个 PR 的最大迭代。Voice Mode 支持逐子句流式 TTS、barge-in 打断、本地唤醒词与 VAD 幻觉过滤,STT/TTS 可插拔可全离线。本教程覆盖升级、启用配置、唤醒词、打断实测与跨平台语音。

2026.08.11· 16 分钟阅读· 约 1901 字· 🎙️ Hermes

2026 年 8 月 3 日,Nous Research 发布 Hermes Agent v2026.8.3(The Herald Release)——项目史上最大一次迭代:约 1,400 个 PR、3,650 次提交、650+ 贡献者。最亮眼的是 Voice Mode 从「对讲机」升级成「真对话」:流式 TTS 逐子句播报、开口即可打断(barge-in)、本地唤醒词、VAD 静音感知与幻觉过滤。本教程带你把这个开源语音 Agent 真正跑起来,从配置到调优一条龙。

🧩 本教程适合:装过 Hermes 想升级玩法的用户,以及对「开源实时语音 Agent」感兴趣的人。Hermes 基础安装先读本站《Hermes 零基础装机》;语音 Agent 横向对比可看《OpenAI Realtime 语音智能体》。

先搞懂:Voice Mode 解决了什么?从「对讲机」到「真对话」

此前大多数开源语音 Agent 的交互是「对讲机模式」:你说完 → 等模型处理 → 回放一整段长音频。v0.20 把链路改成实时对话:模型边生成边逐子句播报,你随时可以插话打断,AI 会停下来听你说。三个能力一起构成「自然对话」的体验:

能力旧版体验v0.20 体验
回复播报整段生成完再播放逐子句流式播放,首音 <1 秒
打断不能插话,等播完开口即停,模型知道你打断了它
唤醒手动按键启动本地唤醒词,无需动手
误触发静音也转录VAD 忙碌感知 + 幻觉过滤
💡 与厂商原生语音模型(Grok Voice / GPT-Realtime / Qwen Audio)不同,Hermes 的 STT 和 TTS 是可插拔的:模型不锁定供应商,语音层你自己配,还能全离线。

Step 1:升级到 v0.20

1 三种安装方式,按你的环境选

v0.19.x 用户可以直接升,v0.19.1 的补丁已全部并入:

升级命令:
· pip 安装用户:
pip install --upgrade hermes-agent
· Docker 用户:镜像标签更新到 v2026.8.3
· 桌面应用用户:应用内更新 / 重新下载

升级后检查:
· hermes doctor 一键体检
· 确认版本号:hermes --version → v0.20.x
· 重点验证你依赖的功能面(语音/工具/MCP)
——大版本升级后逐项测,别只看「能启动」

大版本升级 ≠ 平滑升级:v0.20 合并了约 3,650 次提交,配置项可能有变化。升级后先跑一遍日常任务再投入生产。

Step 2:启用 Voice Mode——默认是关的

2 配置文件开启 + 首次配置 STT 端点

语音功能默认不开启,需要主动配置:

配置要点:
① 在 Hermes 配置文件中启用 voice 模式
② 首次使用需配置 STT(语音转文字)端点
· 支持 OpenAI 兼容接口(如 gpt-transcribe)
· 也支持本地 Whisper(全离线)
③ 在 CLI 或 TUI 中开启语音交互即可对话

最小配置示例(示意,按官方文档为准):
voice:
enabled: true
stt: whisper_local      # 本地 Whisper
tts: edge               # 免费 Edge TTS

验证:
· 说一句话,看是否转写正确
· 听回复,确认 TTS 正常播报
💡 想零成本开跑:本地 Whisper(STT)+ Edge TTS(TTS)组合完全免费,且全程离线——适合隐私敏感场景。

Step 3:配置 TTS 与唤醒词

3 语音层自由组合,唤醒词完全本地

STT / TTS / 唤醒词三者独立配置,互相不锁死:

STT 选项:
· 本地 Whisper(默认)——全离线,隐私最优
· Whisper API / OpenAI STT —— 云端更准
· Edge STT —— 免费

TTS 选项:
· Edge TTS(默认)——免费,适合原型/内部工具
· OpenAI TTS —— 音质更好
· Google Cloud TTS —— 云生态集成
(换 TTS 只需改一处配置,不影响 Agent 逻辑)

唤醒词:
· Porcupine(本地模型)或自定义 hotword
· 支持开放词汇自定义,如 "hey Hermes"
· 检测完全在本地完成——等待期间
没有任何音频离开你的机器
· 不同唤醒词可路由到不同 profile
· 说 "stop" 可跨所有界面终止语音会话

质量提示:
· Edge TTS 免费但音质一般(适合 Demo)
· 追求质量换 OpenAI TTS 或专用语音模型
💡 隐私卖点:唤醒词监听全程本地,只有唤醒后才启动完整 STT 链路——既省 API 额度,又保证「等待时不上传音频」。

Step 4:实测打断与连续对话

4 barge-in、VAD 与幻觉过滤,逐个验收

「真对话」体验的关键在细节,实测清单:

验收项一:打断(barge-in)
· 让 Agent 回答一个问题,说到一半你插话
· 预期:立即停止播报 → 转为倾听 → 结合
你的打断内容继续/调整回复
· 这是级联式语音链路最难做对的一环

验收项二:忙碌感知(VAD)
· 你思考停顿不说话时,AI 不应误触发
· 预期:静音不转写、不抢话

验收项三:幻觉过滤
· 在安静环境测试
· 预期:Whisper 不会把环境静音
转成无意义文本喂给模型

验收项四:连续对话
· 多轮语音往返,中途不手动按键
· 配合唤醒词,模拟「对着电脑说话」的
常驻助手体验

打断体验依赖硬件:回声消除差的麦克风/扬声器组合可能让 barge-in 失灵。实测发现异常先检查音频设备,再怀疑配置。

Step 5:跨平台语音——QQ / 飞书 / WhatsApp 都能说

5 从终端走向 IM 渠道

v0.20 把语音能力扩展到了即时通讯渠道:

支持渠道:
· WhatsApp / LINE / QQ / 飞书
· 语音消息转录与回复:收到语音 → 转写 →
模型处理 → TTS 回语音

端到端验证链路(IM 渠道):
① 发送一条真实语音消息
② 确认转录语言正确
③ 确认模型正确理解并响应
④ 确认返回的语音可播放
(网关显示「在线」≠ 语音链路完整可用,
必须实测整个链路)

配合用法:
· 配合签名 Webhook,任务完成自动推送
· 配合 A2A v1.0,多个 Hermes 实例组网
(一个搜资料、一个跑代码、主 Agent 汇总)
💡 v0.20 同期还带来:A2A v1.0 协议(Agent 之间互相发现与通信)、签名出站 Webhook、grounded research 可信引用、工具调用迭代上限从 90 提到 500。语音只是这版最显眼的那块。

Step 6:隐私与质量调优

6 从「能跑」到「好用」的最后一步

按你的场景把语音链路调到位:

隐私优先组合(全离线):
· 本地 Whisper + 本地 LLM(Ollama/vLLM)
+ Edge TTS —— 音频与推理都不出机器
· 唤醒词本地检测,等待期零上传

质量升级路径:
· STT 不准 → 换 Whisper API / OpenAI STT
· TTS 生硬 → 换 OpenAI TTS / 专用语音模型
· 延迟高 → 检查 TTS 流式配置是否生效
(首音 <1 秒是验收线)

常见坑:
· 静音环境被转录 → 确认幻觉过滤已开启
· 打断失灵 → 查回声消除与麦克风设备
· 唤醒词不灵 → 换短语/调整 Porcupine 灵敏度
🎉 小结:Hermes v0.20 把「开源语音 Agent」从能听能说,做成了「能自然对话、能打断、能唤醒、能全离线」的完整体验。配置一句话总结:启用 Voice Mode → 配 STT/TTS → 设唤醒词 → 实测打断 → 按需调质量。想对比商业化语音方案,可回看本站《OpenAI Realtime 语音智能体》。

常见问题速查

你的疑问参考答案
Voice Mode 默认开吗?默认关闭,需配置文件启用并配置 STT 端点
要花多少钱?本地 Whisper + Edge TTS 组合完全免费;云端 STT/TTS 按供应商计费
能完全离线吗?能:本地 Whisper + 本地 LLM + Edge TTS 全链路不出机器
唤醒词会监听我吗?检测在本地完成,唤醒前无音频外传
和 OpenAI Realtime 比怎样?Hermes 胜在开源可自托管、语音层可插拔;Realtime 胜在原生端到端模型
v0.19 配置要重写吗?大部分兼容,但建议升级后跑 hermes doctor 并逐项验证
← 返回教程中心