MMLU(大规模多任务语言理解)
别名:MMLUMassive Multitask Language Understanding多任务理解知识评测
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 15 分钟 |
| 更新时间 | 📅 2026-07-02 |
| 条目编号 | ENC-BENCH-04-mmlu |
MMLU(Massive Multitask Language Understanding)是一个覆盖 57 个学科的多项选择题评测集,用于评估 LLM 的知识广度和推理能力。涵盖人文、社会科学、自然科学、工程技术等领域。
关键要点 ✦
- MMLU 包含 15908 道选择题,覆盖 57 个学科从 STEM 到人文
- 2026 年顶级模型已突破 90%(GPT-4o 92.3%,Claude 4 91.8%,Gemini 2.5 Pro 91.5%)
- MMLU 的饱和问题日益严重——顶级模型差距已缩小至 2% 以内
- MMLU-Pro 是 2025 年推出的更难版本,减少简单题目,增加推理题目
- MMLU 偏重知识记忆而非深度推理,不能完全反映 Agent 的实际能力
详细解释
MMLU(Massive Multitask Language Understanding)由 UC Berkeley 和 Meta 于 2020 年提出,是最有影响力的 LLM 评测基准之一。它包含 57 个学科共 15908 道多项选择题,涵盖人文、社科、理工、医学等领域。
2026 年 GPT-4o 以 92.3% 领先,Claude 4(91.8%)、Gemini 2.5 Pro(91.5%)紧随其后。顶级模型的差距已缩小至 2% 以内——MMLU 已无法有效区分头部模型的能力差异。
局限与演进
MMLU 的主要局限:选择题格式不能反映真实使用场景、可能存在数据污染(训练数据中包含测试题目)、偏重知识记忆而非推理能力。MMLU-Pro(2025 年)通过增加推理题、减少简单题来提升区分度。MMLU 在 2026 年更多被用作基线测试而非对比评测。
🎯 应用场景
模型对比
作为不同模型间的通用知识水平参考基准。
回归测试
模型厂商在发布新版本时运行 MMLU 确保通用能力未下降。
✅ 最佳实践
- 将 MMLU 作为模型通用知识的参考指标,而非决策的唯一依据
- 结合 MMLU-Pro、SWE-bench 等多维度评测综合评估模型能力
- 关注 MMLU 各子领域的得分分布,而非仅看总分
🔮 未来展望
MMLU 正在被 LiveBench、HELM 等更难、更动态的基准替代。但 MMLU 的历史意义不可替代——它首次建立了多维度的 LLM 知识评估标准。
📖 相关条目
🛠️ 相关产品
🏷️ 标签MMLU评测多任务知识LLM