📊 评测基准

HumanEval(代码生成基准)

别名:HumanEval代码生成评测函数级编码OpenAI基准
分类📊 评测基准
阅读时间⏱️ 16 分钟
更新时间📅 2026-06-30
条目编号ENC-BENCH-03-humaneval
HumanEval 是 OpenAI 于 2021 年发布的代码生成评测基准,包含 164 个手写编程题。每个题目包含函数签名、文档字符串和多个测试用例,要求模型生成能通过所有测试的函数实现。

关键要点 ✦

详细解释

HumanEval 是 OpenAI 于 2021 年发布的代码生成评测基准,包含 164 个手写编程题。每个题目提供函数签名、文档字符串和多个测试用例,要求模型生成能通过所有测试的函数实现。它曾是引用最广泛的 AI 编程能力评测标准。

现状与局限

2026 年主流模型已接近饱和:GPT-4o 达 92%,Claude 4 达 94%,DeepSeek-V3 达 90%。

HumanEval 的局限日益明显:题目数量太少(164 题,统计显著性不足)、题目过于简单(主要是函数级实现,不能反映真实开发)、无法区分顶级模型的能力差异(顶尖模型分数在 5% 范围内波动)。

2026 年的趋势是:HumanEval 更多被用作回归测试(确保新版本不低于旧版本),而非用于能力对比。SWE-bench 已取代 HumanEval 成为代码 Agent 评测的黄金标准。

📖 相关条目

🛠️ 相关产品

🏷️ 标签HumanEval基准测试代码生成OpenAI函数级