GAIA(通用AI助手基准)
别名:GAIA通用AI基准AI助手评测多模态基准
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 16 分钟 |
| 更新时间 | 📅 2026-06-30 |
| 条目编号 | ENC-BENCH-02-gaia |
GAIA(General AI Assistants)是由 Meta FAIR 团队提出的通用 AI 助手能力评测基准。它设计了 466 个需要多步推理、工具使用和多模态理解的真实世界问题。
关键要点 ✦
- GAIA 的题目需要多步推理 + 工具使用 + 多模态理解才能解决
- 人类基准得分 92%,2025 年 AI 最好水平约 68%,2026 年已突破 85%
- 分为三个难度等级:简单(单步)、中等(几步)、困难(多步+工具)
- GAIA 比传统基准更接近真实使用场景
- 局限:对工具调用的依赖使模型无法直接在纯文本上运行
详细解释
GAIA(General AI Assistants)由 Meta FAIR 团队于 2023 年发布,是目前最接近真实使用场景的 AI 助手评测基准。它包含 466 个精心设计的问题,每个问题都需要多步推理、工具使用和多模态理解才能解决。
GAIA 的设计理念是:测试 AI 是否具备"人类级别的通用助手能力",而非单纯的文本理解能力。
评测特点
人类基准:92%。2025 年 AI 最佳成绩约 68%,2026 年已突破 85%(Claude 4 + Computer Use)。
三个难度等级:Level 1(单步操作,如从网页提取信息)、Level 2(几步推理+工具,如"找出 2025 年诺贝尔物理学奖得主的维基百科页面中的引用最多的参考文献")、Level 3(复杂多步任务,如"分析某公司的财务报告,计算其收入增长率并生成图表")。
GAIA 的关键洞察是:AI 在单一能力上已超越人类,但在综合使用多种能力(搜索+推理+工具+多模态)解决实际问题上仍有差距。
📖 相关条目
🛠️ 相关产品
🏷️ 标签GAIA基准测试AI助手多模态Meta