MT-Bench(多轮对话能力)
别名:MT-Bench多轮对话指令遵循对话评测LLM Judge
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 13 分钟 |
| 更新时间 | 📅 2026-07-16 |
| 条目编号 | ENC-BENCH-11-mt-bench |
MT-Bench 是用「大模型评委(LLM-as-Judge)」评测模型多轮对话与指令遵循能力的基准,含 80 组需两轮交互的问题,兼顾开放问答与推理任务,是早期广泛采用的对话质量标尺。
关键要点 ✦
- MT-Bench 用 LLM 评委评测多轮对话与指令遵循
- 80 组两轮问题,覆盖写作/推理/数学/代码等
- 开创了「LLM-as-Judge」的可扩展评测范式
- 关注「第二轮是否记得并延续第一轮」
- 局限:评委模型自身偏差会影响评分
基准结构
MT-Bench 包含 80 组对话,每组要求模型进行两轮交互,覆盖写作、角色扮演、推理、数学、代码、知识、通用等类别。重点考察两点:指令遵循(是否按格式/约束作答)与多轮一致性(第二轮是否记住并延续第一轮上下文)。
LLM-as-Judge 范式
MT-Bench 首创用强模型当评委给回答打分(0–10),解决了人工评测成本高、难规模化的问题。这一范式深远影响后续评测(如许多榜单的自动评分)。但评委模型自身有偏差(偏好长回答、特定风格),需配合人工校准。
在 Agent 评测中的位置
MT-Bench 测的是底座对话与指令能力,是 Agent 的「基本功」。一个 Agent 即使架构精妙,若底层模型 MT-Bench 弱(指令听不懂、多轮记不住),整体也难用好。
🎯 应用场景
模型对话质量对比
横向比较多轮指令遵循与一致性。
Agent 底座筛选
用 MT-Bench 初筛候选模型的对话基本功。
评测方法研究
分析 LLM 评委的偏差与校准方式。
✅ 最佳实践
- 用 LLM 评委时辅以人工校准,防风格偏好偏差
- 关注第二轮一致性,而非只看首轮得分
- 将 MT-Bench 与任务型基准(如 AgentBench)结合
- 对评委模型自身做偏差测试
🔮 未来展望
MT-Bench 的「LLM-as-Judge」思想将演化为更严谨的评测基础设施:多评委投票、可解释评分理由、与人类偏好对齐校准,成为 Agent 评测链条不可或缺的一环。
📖 相关条目
🛠️ 相关产品
🏷️ 标签MT-Bench多轮对话指令遵循LLM Judge评测基准