让 AI Agent 具备"自我进化"能力,是智能体领域最具吸引力的愿景之一。但实现这一愿景面临一个核心矛盾:自进化需要持续的学习信号,而真实部署环境中,这些信号——成功轨迹、预定义技能库、明确的人工反馈——往往难以同时满足。
2026 年 6 月上旬,里海大学计算机科学与工程系助理教授孙立超团队及其合作者提出了 OpenSkill 框架,为这个难题提供了一个全新的解题思路:让 Agent 在不依赖目标任务监督信号的前提下,通过开放世界的知识获取,自主学习可执行、可迁移的技能。
现有方法的三个瓶颈
当前主流的 Agent 自进化方法大致分为三类:依赖成功执行轨迹(ReAct 等)、依赖预定义技能库(Voyager 等)、或者依赖 LLM 生成的监督信号。这些方法在实际部署中各有短板。
依赖成功轨迹的问题在于:Agent 在全新任务中根本没有历史成功记录可参考,"先有鸡还是先有蛋"的困境始终无法绕开。依赖预定义技能库的问题在于:技能库需要人工维护,更新成本高,且很难覆盖所有可能场景。依赖 LLM 生成信号的问题在于:生成的信号质量参差不齐,且受限于 LLM 自身的知识边界。
孙立超团队对这三种现状的判断是:不是 Agent 缺乏学习能力,而是现有的"信号供给"方式存在系统性的短板。OpenSkill 的出发点,就是切断 Agent 自进化对"目标任务监督信号"的依赖。
OpenSkill 的三步流程
OpenSkill 的核心框架由三个环节构成:开放世界知识获取、无泄漏技能进化、零样本评估。
第一步,开放世界知识获取。 Agent 从海量开放域数据(包括网络文本、代码库、知识图谱等)中自主提取任务无关的知识片段,而非依赖于特定任务场景下的经验积累。这让 Agent 能够在遇到新任务之前就具备一定的"背景知识储备"。
第二步,无泄漏技能进化。 在获取知识的基础上,Agent 自主生成可执行的新技能。所谓"无泄漏",指的是技能生成过程中不依赖目标任务的测试信号——Agent 不是在针对特定任务反复练习,而是在通用能力层面实现技能更新。这避免了传统方法中 Agent 可能"刷题得分"但实际能力未提升的陷阱。
第三步,零样本评估。 学到的技能在未曾见过的任务上进行零样本测试,以检验其真正的泛化能力。只有能通过零样本检验的技能,才算真正被 Agent"学会"。
多项基准刷新 SOTA
研究团队在 SkillsBench、SocialMaze 和 ScienceWorld 等多个基准上进行了实验验证。结果显示,OpenSkill 在所有基准上均取得了当前最优(SOTA)表现。
更具意义的是技能的可迁移性实验:OpenSkill 学到的技能从较强的模型迁移到更弱的模型上时,仍然能够带来显著的性能提升。这意味着 OpenSkill 不仅在单个 Agent 上有效,其学到的技能具有跨模型复用的价值——这对于模型供应商快速迭代和成本优化都具有实际意义。
如果部署在大规模 Agent 集群上,OpenSkill 的"一次学习、多处复用"特性理论上可以大幅降低每个 Agent 的学习成本。一组 Agent 辛苦学会的东西,可以打包转移到所有同类 Agent 上。
自进化 Agent 的产业意义
自进化能力是 AI Agent 从"被动响应工具"走向"主动成长助手"的关键分水岭。目前业界对 Agent 的定位仍然以"预设能力 + 固定流程"为主——Agent 出厂时具备什么能力,上线后就只有什么能力,不会随着使用经验的积累而自然变强。
OpenSkill 提供了一个打破这种静态模式的技术路径。如果 Agent 能够在日常运行中持续从开放世界获取知识、自主生成技能并积累,那么部署时间越长、使用频次越高的 Agent,能力就越强——这与人类员工"越干越熟练"的成长曲线是一致的。
当然,OpenSkill 仍处于学术研究阶段,距离大规模产业部署还有一定距离。开放世界知识获取的质量控制、技能进化中的安全边界、零样本评估的标准统一等问题,都还需要进一步验证。但它的方向无疑是行业所需要的:让 AI Agent 不再只是一个"出厂即巅峰"的工具,而是一个真正能够持续进化的数字伙伴。