📊 评测基准

GPQA(研究生级科学推理)

别名:GPQA研究生问答科学推理Graduate-Level事实推理
分类📊 评测基准
阅读时间⏱️ 13 分钟
更新时间📅 2026-07-16
条目编号ENC-BENCH-10-gpqa
GPQA(Graduate-Level Google-Proof Q&A)是研究生难度的科学推理基准,题目覆盖化学、物理、生物,刻意设计得「靠搜索引擎无法轻易答出」,用以考验模型深层知识与推理能力。

关键要点 ✦

设计初衷

GPQA 由领域专家出题,难度达到研究生/博士入门水平,且刻意设计成「即使会搜索也不易答对」——需要真正理解概念而非查到答案。它用来区分模型是「记住了事实」还是「能推理出结论」。

评测价值

在 Agent 语境下,GPQA 衡量的是底座模型的科学推理天花板:当 Agent 要做科研辅助、技术决策、复杂诊断时,底层模型的 GPQA 水平直接影响上限。推理模型(如 o 系列、Claude 思考模式)显著拉开差距。

与 MMLU 互补

MMLU 测知识广度(多领域基础题),GPQA 测推理深度(少领域难题)。二者配合可勾勒模型「既广且深」还是「偏科」,是选型时的重要参考。

🎯 应用场景

科研辅助 Agent
评估模型能否支撑高难度科学推理。
模型选型
用 GPQA 看推理深度的天花板。
事实性对比
与幻觉率结合判断「真懂还是编」。

✅ 最佳实践

  • 将 GPQA 与 MMLU 结合看广度+深度
  • 关注推理模型相对基础模型的增益
  • 结合领域任务验证迁移效果而非仅看分数
  • 注意题目泄露风险,用私有题集复测

🔮 未来展望

GPQA 将随模型逼近人类专家水平而持续加难(如引入需多步实验设计的题目);同时「可验证推理过程」会比单一答案正确率更受重视。

📖 相关条目

🛠️ 相关产品

🏷️ 标签GPQA研究生问答科学推理基准知识事实性