HumanEval(代码生成基准)
别名:HumanEval代码生成评测函数级编码OpenAI基准
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 16 分钟 |
| 更新时间 | 📅 2026-06-30 |
| 条目编号 | ENC-BENCH-03-humaneval |
HumanEval 是 OpenAI 于 2021 年发布的代码生成评测基准,包含 164 个手写编程题。每个题目包含函数签名、文档字符串和多个测试用例,要求模型生成能通过所有测试的函数实现。
关键要点 ✦
- HumanEval 是目前引用最广泛的代码生成基准
- 2026 年主流模型已接近饱和(GPT-4o 达 92%,Claude 4 达 94%)
- 局限:题目数量少(164 题),无法区分顶级模型的能力差异
- HumanEval 的饱和推动了 SWE-bench 等更难基准的出现
- 2026 年 HumanEval 更多被用作回归测试而非能力评估
详细解释
HumanEval 是 OpenAI 于 2021 年发布的代码生成评测基准,包含 164 个手写编程题。每个题目提供函数签名、文档字符串和多个测试用例,要求模型生成能通过所有测试的函数实现。它曾是引用最广泛的 AI 编程能力评测标准。
现状与局限
2026 年主流模型已接近饱和:GPT-4o 达 92%,Claude 4 达 94%,DeepSeek-V3 达 90%。
HumanEval 的局限日益明显:题目数量太少(164 题,统计显著性不足)、题目过于简单(主要是函数级实现,不能反映真实开发)、无法区分顶级模型的能力差异(顶尖模型分数在 5% 范围内波动)。
2026 年的趋势是:HumanEval 更多被用作回归测试(确保新版本不低于旧版本),而非用于能力对比。SWE-bench 已取代 HumanEval 成为代码 Agent 评测的黄金标准。
📖 相关条目
🛠️ 相关产品
🏷️ 标签HumanEval基准测试代码生成OpenAI函数级