实战 📋 6 个步骤 第 272 / 470 篇

智源 AREX 上手:用「研究→验证→再研究」双循环,把 AI 变成你的研究助理

北京智源 8-11 发布自主研究智能体 AREX:首创研究验证再研究双循环递归框架,内层研究+外层自我改进,10B 激活参数多项基准达或超部分闭源旗舰,权重开源、科研体验版免费。本教程从资讯追踪、论文筛选、播客摘要三个入口讲到双循环机制与自部署路径。

2026.08.13· 15 分钟阅读· 约 2462 字· 🔬 AREX(智源)

2026 年 8 月 11 日,北京智源人工智能研究院发布 AREX——一款「自主研究智能体」,首创「研究→验证→再研究」双循环递归框架:让 AI 在长程任务中持续自我修正,逐步逼近正确答案,而不是一次性地「搜索后回答」。它抓的是「发现—验证不对称性」:完整答案难以一次生成,但候选解一旦形成,就能通过逐项约束验证快速定位不足、指导下一轮研究。目前模型权重已开源(10B 激活参数,多项基准达或超越部分闭源旗舰),科研体验版免费开放。本教程从体验版的三个入口讲到双循环机制与自部署。

🔬 本教程适合:需要长期跟踪行业动态、筛选论文、做综述的科研人员、分析师与内容创作者。想对比其他科研智能体可看本站《混元 Hyra 科研智能体》与《OpenAI4S 科研 Agent》。

先搞懂:自主研究的难点不是「搜不到」,而是「不知道下一步该搜什么」

传统研究式 AI 的问题在于:一轮搜索给出答案就结束了,答案里哪些可靠、哪些缺证据、下一步该补什么,它自己说不清。AREX 用双循环解决这个问题:

循环职责产出
内层 Research Loop围绕研究问题搜索信息、调用工具、收集证据、比较候选一份结构完整、证据可追踪、可审计的「暂定答案」
外层 Self-Improvement Loop对暂定答案逐项审计:哪些条件已充分支持、哪些不确定、哪些缺证据约束级置信判断 → 转化为下一轮的研究目标
💡 关键机制叫 ACU(自主上下文更新):它不是普通摘要,而是「面向下一步行动的研究状态」——保留已验证发现、已排除候选、未解决约束和下一步计划。长程研究真正难的不是例行搜索,而是在关键时刻做对决定:什么时候相信一个证据、什么时候放弃一个候选项、什么时候重整上下文改变方向。

Step 1:体验版三入口:资讯追踪、论文筛选、播客摘要

1 体验版三入口:资讯追踪、论文筛选、播客摘要

打开科研体验版(arex-research.com),入口分三类,均由 AREX 智能体驱动:

三个入口:
① 资讯追踪(行业信息深度整合)
   · 跟踪你关注的行业/公司/技术动态
   · 支持细分方向定制化配置
② 论文筛选(个性化热点追踪)
   · 按研究方向过滤 arXiv 等来源
   · AI 自主读论文、判断相关性
③ 播客摘要(内容提炼)
   · 上传/指定播客内容,自动提炼要点

工作方式:
· 广域浏览 + 细分方向定制结合
· 每轮「研究→验证→再研究」,答案越滚越准
💡 第一次用建议从资讯追踪开始:给自己定一个窄方向(如「AI Agent 记忆系统」),让 AREX 跑几轮,观察它如何补充证据、如何收敛——这是理解它「研究风格」最快的办法。

Step 2:资讯追踪:把「盯盘」交给 AI,每天醒来只有结论

2 资讯追踪:把「盯盘」交给 AI,每天醒来只有结论

设定一个持续追踪任务,例如「跟踪 MCP 生态的最新框架与治理进展」:

配置建议:
① 明确范围:地域 / 时间窗 / 关键词 / 排除词
② 设定交付格式:摘要 + 关键事件时间线 + 证据链接
③ 要求标注置信度:哪些已多方印证、哪些仅单源
④ 设置审计点:每周回看一次证据链是否扎实

AREX 会怎么做:
· 先检索广谱信息形成初版追踪报告
· 逐项验证每条信息源与时效
· 定位缺口 → 下一轮定向搜索补证据
· 更新报告,重复直到条件全部满足

与普通新闻聚合不同,AREX 会在你设置的方向上持续逼近完整解——它对「这条信息是否仍成立」有约束级判断,过期或单源的内容会被标注,而不是混在一起。

💡 把「置信度标注」写进交付格式,是让研究 Agent 结果可用的关键习惯——你不需要它全对,但需要它告诉你哪部分它自己也不确定。

Step 3:论文筛选:让 AI 先读,你只读「值得读的」

3 论文筛选:让 AI 先读,你只读「值得读的」

面对一天成百上千篇新论文,让 AREX 先做第一道筛选:

筛选流程:
① 提供研究主题与判据(如:与 LLM Agent 记忆相关、
   2025 年后、方法有开源实现)
② AREX 检索并初筛候选论文
③ 逐篇验证:读摘要 → 核对方法与结论是否匹配判据
④ 输出分级清单:
   · 强相关且证据完整(建议精读)
   · 相关但存疑(标注疑点:样本量/复现性)
   · 不相关(给出排除理由,可审计)

别跳过验证步骤:AREX 的价值恰在于「验证后」的结论。如果只看它筛出的标题就精读,等于放弃了双循环的收益;建议至少抽查 20% 的「强相关」结果,确认其证据链真实。

Step 4:播客摘要与内容提炼:会议、访谈、长音频的速读通道

4 播客摘要与内容提炼:会议、访谈、长音频的速读通道

播客摘要类任务相对轻量,适合作为熟悉 AREX 交互方式的第二站:

典型请求:
· 「把这场访谈总结成 10 个要点,标注说话人」
· 「提取节目中提到的所有工具与链接,逐个给一句评价」
· 「找出主讲人与嘉宾观点不一致的地方」

收益:
· 长音频 → 结构化要点,省下整段收听时间
· 观点冲突点自动标出,方便你亲自回听复核
💡 摘要类任务的结果要「能审计」:每一条要点都应能对应回原始音频的时间戳或原句,否则宁可不要。

Step 5:理解双循环:为什么「验证缺口」比「堆更多搜索」更重要

5 理解双循环:为什么「验证缺口」比「堆更多搜索」更重要

想用好 AREX,关键是理解它改进答案的方式——不是无限加搜,而是把验证结果翻译成下一轮的研究目标:

一轮完整循环:
① 暂定答案(内层研究产出)
② 逐项约束审计(外层改进)
   · 哪些条件已充分支持 ✓
   · 哪些仍不确定 ?
   · 哪些关键主张缺证据 ✗
③ 若全部满足 → 结束研究输出答案
④ 若仍有缺口 → 验证结果转为下一轮内层研究目标
   (带着「缺什么」去搜,而不是从头再搜一遍)

这也解释了它和「深搜」类工具的本质差异:深搜提高信息量,AREX 提高结论可靠性——它知道自己已成立什么、欠缺什么、下一步最该研究什么,这是「自主研究」和「工具调用」的分水岭。六个评测基准(BrowseComp、DeepSearchQA、WideSearch-en、GAIA、xbench-2510、HLE with tools)分别覆盖信息深度、信息广度、深广结合与端到端智能体能力。

🎉 小结:体验版三步走——先资讯追踪熟悉风格,再论文筛选体验「验证后分级」,最后用播客摘要做轻量日常;理解双循环后,你就能设计出更有效的任务判据。下一步如果想完全自主可控,见 Step 6。

Step 6:进阶:权重开源自部署,把自主研究装进自己的环境

6 进阶:权重开源自部署,把自主研究装进自己的环境

AREX-Base 以 10B 激活参数开放权重,可在自己的环境跑研究管线:

自部署路径:
① 获取权重:Hugging Face BAAI/AREX 合集
   (模型权重已开放下载)
② 按官方文档配置推理环境与工具调用
③ 接入你的数据源(行业库 / 内部文档 / 订阅源)
④ 定制判据与验证规则(对应外层循环)

适合的场景:
· 数据敏感的行业研究(金融、医疗、政务)
· 需要把「研究-验证」规则写进合规流程的团队
· 想基于双循环框架二次开发的工程团队

自部署 ≠ 免运维:10B 激活参数的推理与工具调用管线、长期研究状态(ACU)的存储与审计,都需要自己搭建。先花一周用体验版把工作流跑熟,再评估是否值得自部署。

📌 想系统评测研究 Agent 的输出质量,可参考本站《Agent 评测 Evals》;AREX 的下一步规划是延伸至方案设计、工程实现与性能调优,最终「用户定义问题、AREX 自主探索实验并交付可验证结果」。

常见问题速查

你的疑问参考答案
AREX 免费吗?科研体验版免费开放;模型权重开源可自部署,成本看你自己的算力
模型多大?AREX-Base 10B 激活参数,多项基准达或超越部分闭源旗舰模型
和 Deep Research 类工具有什么区别?深搜提信息量;AREX 通过双循环对答案逐项验证、定位缺口再定向研究,提结论可靠性
权重在哪下载?Hugging Face 的 BAAI/AREX 模型合集;体验版入口 arex-research.com
能接入内部文档吗?体验版面向公开资讯/论文/播客;自部署版本可接入自有数据源
它真的会「自我改进」吗?指的是智能体对自身研究状态与当前答案持续修正,不是在线更新模型参数
← 返回教程中心