8 月 11 日,北京智源人工智能研究院正式发布自主研究智能体 AREX。按照智源的阐述,当 AI 已经能聊天、写代码、用工具之后,下一个阶段是让 AI 自己「做研究」——不再受限于人类知识边界,而是形成「投入能源、转化智力」的新模式。AREX 的核心主张是:长程研究的真正难点不是信息搜索不足,而是在关键时刻做对决定——什么时候相信一条证据、什么时候放弃一个候选项、什么时候重整上下文并改变搜索方向。围绕这一判断,智源给出了一套可复用的「研究—验证—再研究」双循环框架,并将模型权重开放下载。
一、双循环框架:把「研究」变成可迭代的工程
AREX 的机制设计抓住了一个关键的「不对称性」:完整答案难以一次生成,但候选解一旦形成,就可以通过逐项约束验证快速定位不足、指导后续探索——这就是智源所称的「发现—验证不对称性」。基于此,AREX 搭建了两层循环:内层循环负责「研究」,智能体围绕当前研究问题搜索信息、调用工具、收集证据,形成一个暂定答案;外层循环负责「改进」,对暂定答案逐项审计,判断哪些条件已经充分验证、哪些还缺少证据、哪些需要重新研究。若仍有未解决的问题,验证结果会被转化为下一轮的研究目标,让 AI 在「研究—验证—再研究」的循环中不断逼近正确答案。这一思想与谷歌前首席科学家 Jeff Dean 提出的 Discovery Loop 理念形成呼应——未来 AI 需要通过持续实验、反馈与修正形成自主发现能力,而 AREX 正是把这一理念落实为可运行的智能体框架。
二、评测表现:小参数也能摸到闭源旗舰
为了验证 AREX 是否具备真实的自主研究能力,智源在六个基准上做了评测:BrowseComp、DeepSearchQA、WideSearch-en、GAIA、xbench-2510 与 HLE with tools,分别覆盖信息深度、信息广度、深度与广度结合以及端到端智能体能力。据智源公布的结果,AREX-Base 以 10B 激活参数在多项指标上达到或超越部分闭源旗舰模型,展现出均衡的综合竞争力。需要客观看待的是:这类自主研究类基准的评测条件(如允许的工具调用范围、单次运行的时长上限)直接影响成绩,且「达到或超越部分闭源旗舰」的表述意味着并非全面领先;10B 激活参数也提示其主打的不是模型规模的军备竞赛,而是研究决策与验证机制的工程优化。对行业而言,这组数据的意义在于:自主研究能力并非大模型专利,决策机制与验证闭环同样可以显著提升小模型的端到端表现。
三、从模型到平台:自主研究的产品化路径
与模型一同发布的还有 AREX 研究平台——智源将 AI 的自主研究能力封装为面向科研人员和产业用户的日常工具,以模型驱动的内容获取与研究智能体为核心,提供资讯追踪、论文筛选、播客提取等功能,未来还将延伸至方案设计、工程实现与性能调优等研究执行阶段。同时,AREX 同步发布了科研体验版线上系统,为用户提供行业信息深度整合、个性化热点追踪等技术服务。这一「模型+平台」的组合,与 8 月初 OpenAI 内部版 Astra 在十个长期未解数学与理论计算机科学开放问题上取得新结果的动态同频:头部机构正在把 AI 从「答题」推向「发现」,而自主研究智能体成为新的竞争焦点。区别在于,OpenAI 的尝试仍处于内部研究阶段,智源则选择了权重开放与平台上线的更开放路径,降低了科研机构复现与二次开发的门槛。
四、客观看:自主研究的边界与未尽问题
几点客观边界需要标注。其一,「自主研究」目前仍以信息检索、证据组织与假设验证为主,距离真正提出原创科学问题、设计全新实验仍有距离——AREX 的评测基准大多围绕已知答案的检索与推理类任务展开;其二,10B 激活参数「对标部分闭源旗舰」的具体对比对象与评测配置,智源未完整披露,跨机构基准的公平性仍需独立复现验证;其三,长程自主运行带来的成本与失控风险是此类智能体的共同课题——自主研究智能体在长时间运行中若缺乏人工审查节点,其产出的可靠性边界尚未被充分讨论;其四,AREX 研究平台的商业与开放策略(如是否面向企业提供 API、数据隐私如何保障)行业暂未披露。总体而言,AREX 的价值在于把「AI 做研究」从一个模糊的口号变成了一套可迭代的工程框架,并以开源姿态降低行业试错成本——它未必是研究智能体的终局,但提供了一个可被验证、可被改进的起点。