📊 评测基准

GAIA(通用AI助手基准)

别名:GAIA通用AI基准AI助手评测多模态基准
分类📊 评测基准
阅读时间⏱️ 16 分钟
更新时间📅 2026-06-30
条目编号ENC-BENCH-02-gaia
GAIA(General AI Assistants)是由 Meta FAIR 团队提出的通用 AI 助手能力评测基准。它设计了 466 个需要多步推理、工具使用和多模态理解的真实世界问题。

关键要点 ✦

详细解释

GAIA(General AI Assistants)由 Meta FAIR 团队于 2023 年发布,是目前最接近真实使用场景的 AI 助手评测基准。它包含 466 个精心设计的问题,每个问题都需要多步推理、工具使用和多模态理解才能解决。

GAIA 的设计理念是:测试 AI 是否具备"人类级别的通用助手能力",而非单纯的文本理解能力。

评测特点

人类基准:92%。2025 年 AI 最佳成绩约 68%,2026 年已突破 85%(Claude 4 + Computer Use)。

三个难度等级:Level 1(单步操作,如从网页提取信息)、Level 2(几步推理+工具,如"找出 2025 年诺贝尔物理学奖得主的维基百科页面中的引用最多的参考文献")、Level 3(复杂多步任务,如"分析某公司的财务报告,计算其收入增长率并生成图表")。

GAIA 的关键洞察是:AI 在单一能力上已超越人类,但在综合使用多种能力(搜索+推理+工具+多模态)解决实际问题上仍有差距。

📖 相关条目

🛠️ 相关产品

🏷️ 标签GAIA基准测试AI助手多模态Meta