2026 年 8 月 11 日,北京智源人工智能研究院发布 AREX——一款「自主研究智能体」,首创「研究→验证→再研究」双循环递归框架:让 AI 在长程任务中持续自我修正,逐步逼近正确答案,而不是一次性地「搜索后回答」。它抓的是「发现—验证不对称性」:完整答案难以一次生成,但候选解一旦形成,就能通过逐项约束验证快速定位不足、指导下一轮研究。目前模型权重已开源(10B 激活参数,多项基准达或超越部分闭源旗舰),科研体验版免费开放。本教程从体验版的三个入口讲到双循环机制与自部署。
先搞懂:自主研究的难点不是「搜不到」,而是「不知道下一步该搜什么」
传统研究式 AI 的问题在于:一轮搜索给出答案就结束了,答案里哪些可靠、哪些缺证据、下一步该补什么,它自己说不清。AREX 用双循环解决这个问题:
| 循环 | 职责 | 产出 |
|---|---|---|
| 内层 Research Loop | 围绕研究问题搜索信息、调用工具、收集证据、比较候选 | 一份结构完整、证据可追踪、可审计的「暂定答案」 |
| 外层 Self-Improvement Loop | 对暂定答案逐项审计:哪些条件已充分支持、哪些不确定、哪些缺证据 | 约束级置信判断 → 转化为下一轮的研究目标 |
Step 1:体验版三入口:资讯追踪、论文筛选、播客摘要
打开科研体验版(arex-research.com),入口分三类,均由 AREX 智能体驱动:
三个入口:
① 资讯追踪(行业信息深度整合)
· 跟踪你关注的行业/公司/技术动态
· 支持细分方向定制化配置
② 论文筛选(个性化热点追踪)
· 按研究方向过滤 arXiv 等来源
· AI 自主读论文、判断相关性
③ 播客摘要(内容提炼)
· 上传/指定播客内容,自动提炼要点
工作方式:
· 广域浏览 + 细分方向定制结合
· 每轮「研究→验证→再研究」,答案越滚越准
Step 2:资讯追踪:把「盯盘」交给 AI,每天醒来只有结论
设定一个持续追踪任务,例如「跟踪 MCP 生态的最新框架与治理进展」:
配置建议:
① 明确范围:地域 / 时间窗 / 关键词 / 排除词
② 设定交付格式:摘要 + 关键事件时间线 + 证据链接
③ 要求标注置信度:哪些已多方印证、哪些仅单源
④ 设置审计点:每周回看一次证据链是否扎实
AREX 会怎么做:
· 先检索广谱信息形成初版追踪报告
· 逐项验证每条信息源与时效
· 定位缺口 → 下一轮定向搜索补证据
· 更新报告,重复直到条件全部满足
与普通新闻聚合不同,AREX 会在你设置的方向上持续逼近完整解——它对「这条信息是否仍成立」有约束级判断,过期或单源的内容会被标注,而不是混在一起。
Step 3:论文筛选:让 AI 先读,你只读「值得读的」
面对一天成百上千篇新论文,让 AREX 先做第一道筛选:
筛选流程:
① 提供研究主题与判据(如:与 LLM Agent 记忆相关、
2025 年后、方法有开源实现)
② AREX 检索并初筛候选论文
③ 逐篇验证:读摘要 → 核对方法与结论是否匹配判据
④ 输出分级清单:
· 强相关且证据完整(建议精读)
· 相关但存疑(标注疑点:样本量/复现性)
· 不相关(给出排除理由,可审计)
别跳过验证步骤:AREX 的价值恰在于「验证后」的结论。如果只看它筛出的标题就精读,等于放弃了双循环的收益;建议至少抽查 20% 的「强相关」结果,确认其证据链真实。
Step 4:播客摘要与内容提炼:会议、访谈、长音频的速读通道
播客摘要类任务相对轻量,适合作为熟悉 AREX 交互方式的第二站:
典型请求:
· 「把这场访谈总结成 10 个要点,标注说话人」
· 「提取节目中提到的所有工具与链接,逐个给一句评价」
· 「找出主讲人与嘉宾观点不一致的地方」
收益:
· 长音频 → 结构化要点,省下整段收听时间
· 观点冲突点自动标出,方便你亲自回听复核
Step 5:理解双循环:为什么「验证缺口」比「堆更多搜索」更重要
想用好 AREX,关键是理解它改进答案的方式——不是无限加搜,而是把验证结果翻译成下一轮的研究目标:
一轮完整循环:
① 暂定答案(内层研究产出)
② 逐项约束审计(外层改进)
· 哪些条件已充分支持 ✓
· 哪些仍不确定 ?
· 哪些关键主张缺证据 ✗
③ 若全部满足 → 结束研究输出答案
④ 若仍有缺口 → 验证结果转为下一轮内层研究目标
(带着「缺什么」去搜,而不是从头再搜一遍)
这也解释了它和「深搜」类工具的本质差异:深搜提高信息量,AREX 提高结论可靠性——它知道自己已成立什么、欠缺什么、下一步最该研究什么,这是「自主研究」和「工具调用」的分水岭。六个评测基准(BrowseComp、DeepSearchQA、WideSearch-en、GAIA、xbench-2510、HLE with tools)分别覆盖信息深度、信息广度、深广结合与端到端智能体能力。
Step 6:进阶:权重开源自部署,把自主研究装进自己的环境
AREX-Base 以 10B 激活参数开放权重,可在自己的环境跑研究管线:
自部署路径:
① 获取权重:Hugging Face BAAI/AREX 合集
(模型权重已开放下载)
② 按官方文档配置推理环境与工具调用
③ 接入你的数据源(行业库 / 内部文档 / 订阅源)
④ 定制判据与验证规则(对应外层循环)
适合的场景:
· 数据敏感的行业研究(金融、医疗、政务)
· 需要把「研究-验证」规则写进合规流程的团队
· 想基于双循环框架二次开发的工程团队
自部署 ≠ 免运维:10B 激活参数的推理与工具调用管线、长期研究状态(ACU)的存储与审计,都需要自己搭建。先花一周用体验版把工作流跑熟,再评估是否值得自部署。
常见问题速查
| 你的疑问 | 参考答案 |
|---|---|
| AREX 免费吗? | 科研体验版免费开放;模型权重开源可自部署,成本看你自己的算力 |
| 模型多大? | AREX-Base 10B 激活参数,多项基准达或超越部分闭源旗舰模型 |
| 和 Deep Research 类工具有什么区别? | 深搜提信息量;AREX 通过双循环对答案逐项验证、定位缺口再定向研究,提结论可靠性 |
| 权重在哪下载? | Hugging Face 的 BAAI/AREX 模型合集;体验版入口 arex-research.com |
| 能接入内部文档吗? | 体验版面向公开资讯/论文/播客;自部署版本可接入自有数据源 |
| 它真的会「自我改进」吗? | 指的是智能体对自身研究状态与当前答案持续修正,不是在线更新模型参数 |