📊 评测基准

MMLU(大规模多任务语言理解)

别名:MMLUMassive Multitask Language Understanding多任务理解知识评测
分类📊 评测基准
阅读时间⏱️ 15 分钟
更新时间📅 2026-07-02
条目编号ENC-BENCH-04-mmlu
MMLU(Massive Multitask Language Understanding)是一个覆盖 57 个学科的多项选择题评测集,用于评估 LLM 的知识广度和推理能力。涵盖人文、社会科学、自然科学、工程技术等领域。

关键要点 ✦

详细解释

MMLU(Massive Multitask Language Understanding)由 UC Berkeley 和 Meta 于 2020 年提出,是最有影响力的 LLM 评测基准之一。它包含 57 个学科共 15908 道多项选择题,涵盖人文、社科、理工、医学等领域。

2026 年 GPT-4o 以 92.3% 领先,Claude 4(91.8%)、Gemini 2.5 Pro(91.5%)紧随其后。顶级模型的差距已缩小至 2% 以内——MMLU 已无法有效区分头部模型的能力差异。

局限与演进

MMLU 的主要局限:选择题格式不能反映真实使用场景、可能存在数据污染(训练数据中包含测试题目)、偏重知识记忆而非推理能力。MMLU-Pro(2025 年)通过增加推理题、减少简单题来提升区分度。MMLU 在 2026 年更多被用作基线测试而非对比评测。

🎯 应用场景

模型对比
作为不同模型间的通用知识水平参考基准。
回归测试
模型厂商在发布新版本时运行 MMLU 确保通用能力未下降。

✅ 最佳实践

  • 将 MMLU 作为模型通用知识的参考指标,而非决策的唯一依据
  • 结合 MMLU-Pro、SWE-bench 等多维度评测综合评估模型能力
  • 关注 MMLU 各子领域的得分分布,而非仅看总分

🔮 未来展望

MMLU 正在被 LiveBench、HELM 等更难、更动态的基准替代。但 MMLU 的历史意义不可替代——它首次建立了多维度的 LLM 知识评估标准。

📖 相关条目

🛠️ 相关产品

🏷️ 标签MMLU评测多任务知识LLM