📊 评测基准

LiveBench(实时基准评测)

别名:LiveBench实时评测动态基准避免污染LMSYS
分类📊 评测基准
阅读时间⏱️ 14 分钟
更新时间📅 2026-07-02
条目编号ENC-BENCH-05-livebench
LiveBench 是由 LMSYS 组织推出的动态评测基准,通过定期发布新题目的方式防止数据污染。它覆盖推理、编程、数学、语言理解等多个维度。

关键要点 ✦

详细解释

LiveBench 由 LMSYS 组织(以 Chatbot Arena 闻名)于 2024 年推出,核心创新是「定期更新题库」——每月发布新题目,确保模型没有预先见过测试数据。

2026 年 MMLU 的饱和和数据污染问题日益严重,LiveBench 作为替代方案获得了广泛认可。它覆盖推理、编程、数学、语言理解、知识问答、多模态等维度。

排行榜(2026 Q2)

总排名:GPT-o3(87.3%)> Claude 4(85.1%)> Gemini 2.5 Pro(82.7%)> DeepSeek-V4(80.2%)。

编程维度:Claude 4 领先;推理维度:GPT-o3 领先;数学维度:GPT-o3 领先。

LiveBench 的区分度比 MMLU 好得多——头部模型差距约 5-10%,能清晰反映各模型的能力差异。

🎯 应用场景

模型选型
企业根据 LiveBench 各维度得分选择最适合业务场景的模型。
版本追踪
模型厂商使用 LiveBench 追踪每次更新带来的实际能力变化。

✅ 最佳实践

  • 参考 LiveBench 中与业务场景相关的维度得分,而非只看总分
  • 结合 Chatbot Arena 的人类评分一起评估,获得客观+主观的完整视图
  • 关注模型在 LiveBench 上的趋势变化,而非单次得分

🔮 未来展望

LiveBench 正在成为 MMLU 的继承者。其动态题库理念也在影响其他基准的设计——2027 年大多数评测基准将采用定期更新机制。

📖 相关条目

🛠️ 相关产品

🏷️ 标签LiveBench实时评测数据污染动态基准LMSYS