AI 科研的范式,正在从「人训练模型」转向「模型自己迭代研究」。7 月 21 日,腾讯混元发布科研与科学发现智能体 Hyra-1.0(Hunyuan Research Agent)。它不像通用聊天机器人那样追求对话体验,而是把「提出假设—写代码—跑实验—看反馈—改方案」这一整套研究闭环,交给一个能递归自我改进的智能体自己去转。在 AlphaEvolve、Together AI Einstein Arena、Karpathy autoresearch 之后,Hyra 把统一框架下的自动化科研,第一次推进到了真实产品与工业系统之中。

一、Hyra 是什么:一个极简 Harness,两个不停对话的角色

Hyra 的设计哲学明确遵循「苦涩的教训」——框架保持轻量,把尽可能大的行动空间交给智能体,靠计算与搜索取胜,而不是堆砌先验规则。其核心是一套异步的「生产者—消费者」管线:一个 Context Agent 持续维护一个 Experience Bank(经验库),记录过往所有方案、评估分数与执行日志,并把其中有价值的片段综合成「灵感」,源源不断投入任务队列;多个 Proposal Agent 则从队列里取走灵感,反思后写出新方案,落到以 solve.sh 为入口的 solution 目录,在隔离沙箱里跑一遍、拿分数,再把工件回传给经验库。信号量控制并发,让方案质量随时间和算力稳定提升。当任务本身连评估器都没有时,Hyra 会升级为「双层循环」:先用任务描述生成一个初始评估器,内层循环拿它反复改进方案;内层结束后,再用经验库里攒下的信息反过来改进评估器本身——比如让评估代码更高效、减少奖励作弊(reward hacking)、加上更细的反馈颗粒度。这套机制,让智能体不只是「解题」,而是在「改进自己解题的方法」。

二、AI for AI:三项公开任务全部跑赢 Recursive 基线

在 AI 研发流水线这一最天然的应用场景里,Hyra 沿用了 Recursive 公开的三个任务定义、评估协议与初始方案做公平较量,三个任务全部胜出。NanoChat Autoresearch 上把 Validation BPB 压到 0.9015;NanoGPT Speedrun 中让模型达到特定验证损失的时间,从 Recursive 基线的 77.5 秒压缩到 76.4 秒;SOL-ExecBench 的 235 个 GPU kernel 联合优化里取得 0.771 的 Mean SOL。值得注意的是,这几个任务都已被研究社区反复打磨,基线本身并不弱——Hyra 赢在「把每次成功与失败都变成可复用经验」的迭代飞轮上。

三、AI for Science:29/55 数学题刷新、太阳黑子公式样本外 R²=0.77

在科学发现一侧,Hyra 收集了 55 个开放数学问题,在其中 29 个上取得了新的已知最优结果。更耐人寻味的是它对真实观测数据的处理:在 1749—1932 年的月度太阳黑子数据上,Hyra 发现了一个能预测黑子数的递推关系,并把它用于 1932—2026 年的样本外数据,R² 达到 0.77。在量子计算上,它为 IBM Q20 设计的路由算法相比经典 SABRE 方法效率提升 44.4%;在药物设计中,针对靶点 PARP1 生成的候选分子,在结合—成药联合评分上超过了已上市药物奥拉帕利(olaparib);它还设计出一个仅含 15 个可训练参数的微型 Transformer,能够完成两个 10 位数的加法运算。这些结果横跨数学、天文、量子、药学与芯片,说明同一套 Harness 可以跨领域迁移,而非为某一任务定制。

四、AI for Fun 与开源:从棋盘到 3D,结果已上 Github

在更开放的场景里,Hyra 通过自对弈开发的黑白棋 bot,在 Botzone 平台的 730 个参赛作品中排名第 3;它还能从单张 2D 图像生成可渲染的 3D 模型,并把一段旋律发展为多乐器、色彩丰富的完整配器。腾讯表示,Hyra 的开源结果已发布于 Github,后续将推动它与新一代 Hy 模型及产品持续共进化,并招募合作者。把科研智能体的「工件」而非仅「论文」开放出来,是这类系统走向社区验证的关键一步。

五、客观看:科研范式被改写了,但边界仍在

Hyra 的意义,不在于某一项指标多惊艳,而在于它把「自动化科研」从单点 Demo 变成了可复用的工程框架,并直接嵌入腾讯的产品系统、AI 研发流水线与工业场景。它的核心优势——把每一次试错沉淀为经验、迭代速度远超人工——正是长链路科研最稀缺的东西。但客观说,边界同样清晰:第一,它高度依赖「可评估」任务,凡是没有明确评分函数的开放问题,都需先造评估器,而评估器本身也可能被钻空子;第二,它究竟是「研究员替代者」还是「研究员加速器」,仍取决于人类在目标设定与验收上的把关;第三,关于训练成本、规模上限与是否开放权重,行业暂未披露。可以肯定的是:当 AI 开始「研究 AI」并跑赢人类基线,科研的生产关系,已经悄悄松动了。