GPQA(研究生级科学推理)
别名:GPQA研究生问答科学推理Graduate-Level事实推理
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 13 分钟 |
| 更新时间 | 📅 2026-07-16 |
| 条目编号 | ENC-BENCH-10-gpqa |
GPQA(Graduate-Level Google-Proof Q&A)是研究生难度的科学推理基准,题目覆盖化学、物理、生物,刻意设计得「靠搜索引擎无法轻易答出」,用以考验模型深层知识与推理能力。
关键要点 ✦
- GPQA 是研究生难度、跨化学/物理/生物的科学问答
- 刻意「Google-Proof」,考验深层知识而非检索
- 是衡量推理模型事实推理能力的关键标尺
- 顶级推理模型已逼近人类专家水平
- 常与 MMLU 配合看「广度+深度」
设计初衷
GPQA 由领域专家出题,难度达到研究生/博士入门水平,且刻意设计成「即使会搜索也不易答对」——需要真正理解概念而非查到答案。它用来区分模型是「记住了事实」还是「能推理出结论」。
评测价值
在 Agent 语境下,GPQA 衡量的是底座模型的科学推理天花板:当 Agent 要做科研辅助、技术决策、复杂诊断时,底层模型的 GPQA 水平直接影响上限。推理模型(如 o 系列、Claude 思考模式)显著拉开差距。
与 MMLU 互补
MMLU 测知识广度(多领域基础题),GPQA 测推理深度(少领域难题)。二者配合可勾勒模型「既广且深」还是「偏科」,是选型时的重要参考。
🎯 应用场景
科研辅助 Agent
评估模型能否支撑高难度科学推理。
模型选型
用 GPQA 看推理深度的天花板。
事实性对比
与幻觉率结合判断「真懂还是编」。
✅ 最佳实践
- 将 GPQA 与 MMLU 结合看广度+深度
- 关注推理模型相对基础模型的增益
- 结合领域任务验证迁移效果而非仅看分数
- 注意题目泄露风险,用私有题集复测
🔮 未来展望
GPQA 将随模型逼近人类专家水平而持续加难(如引入需多步实验设计的题目);同时「可验证推理过程」会比单一答案正确率更受重视。
📖 相关条目
🛠️ 相关产品
🏷️ 标签GPQA研究生问答科学推理基准知识事实性