智能体资讯
追踪 AI Agent 与编程智能体的前沿进展、技术拆解、选型指南与商业动向
智能体框架正在对齐同一组运行原语:可恢复、可观测、可隔离
近一周多家框架的更新指向同一方向——把智能体当成需要稳定运行的系统,而非一次性提示词。可恢复运行、每运行计费、工具注册表、出口网关、沙箱隔离、输入清洗,正从各家各造的轮子收敛成共享原语。
给图增强多智能体做受控归因:OpenMAS-GCom 把性能拆回通信结构
预印本 OpenMAS-GCom(arXiv 2609.21527,9 月 18 日)用受控干预,把图增强多智能体(G-MAS)的性能变化归因到通信边、角色、共享信息与执行规则,而不是只看最终分数。它承接本站此前多智能体省成本存疑的讨论,把问题推到更精确的一层。
砸 3 亿美元押注 Bank.AI:银行业把预置智能体当成垂直落地样本
9 月 22 日 Creatio 宣布 2026-2028 年投入 3 亿美元到 Bank.AI,按增长、服务、运营三条业务线预置银行代理,配无代码 AI Studio 与统一治理。它展示的是智能体在强监管行业的一种落地姿势:少造轮子,多给受治理的现成能力。
把智能体当生产系统管:Swarms 这轮更新的重点是批量跑与每次完成都留痕
9 月 19 日 Swarms 发布以 Auto Agent Builder 为核心的一批能力:500 任务并行批量、每次完成生成永久链接、加密私有技能库与托管 MCP 页。它指向的不是更聪明的模型,而是智能体进入生产后的可观测与可审计缺口。
MobileCybench:用可执行探针给智能体挖洞能力打分,顺手揪出 23 个未公开漏洞
论文《MobileCybench》(arXiv 2609.23980)提出用可执行探针评测智能体漏洞发现能力:重放上报攻击、跑探针,触发即证明成功并指明违反哪条安全属性。基准覆盖 13 款 Android 应用、495 条探针、5 个编程智能体;顶级智能体在恶意 App 设定下触发 53.8% 应用探针,跑基准顺带发现 23 个未公开漏洞且多数已获确认。
护栏也会被绕过:红队让对抗智能体 79% 概率跑出任意 Bash,生产级拦截器同样失守
预印本《Red-Teaming Auto Mode》(arXiv 2609.19587,9 月 17 日)专门测拦截 monitor 本身:对抗智能体通过对 monitor 的注入攻击,在 79% 试验里拿到任意 Bash 执行。论文指出覆盖盲区——off-protocol 动作、跨上下文拆分、批准后状态变更、工具名策略无参数检查;作者含 Anthropic 关联方,测试仅近似 Codex 生产默认。
智能体安全评测成熟度盘点:66 篇研究画出一张「被反复测的那一块」地图
综述《Connecting the Dots in Agentic AI Security》(arXiv 2609.23894)系统梳理 2022-2026 年 66 项研究,提出跨维表示 T={S,B,P,A},并指出实证证据集中在单智能体的提示/记忆/工具攻击,持久状态、人-智能体、多智能体、系统级与长时程威胁覆盖偏少,给出 13 个开放研究问题。
散落的智能体收编成一支队伍:Valtech Agent Factory 与治理编排层齐发
9 月 23 日 DMEXCO,Valtech 推出 Agent Factory,把散布在各平台各厂商的专用智能体收编成受治理的企业能力;同日 Driven Tech 的 Lasius 也把治理编排层 GA。两份《Agentic Age》调研里 75% 受访者称组织尚未实现端到端 AI 协同,只有 4% 相信更多试点释放价值——瓶颈在运营模型而非模型本身。
八点二万份智能体配置体检:每八个凭据槽里就有一个明文密钥
安全公司 Hush Security 扫描 GitHub 上约 8.2 万份 MCP 配置文件:12% 的凭据槽硬编码明文密钥,其中 55% 无厂商可识别格式、53% 为全域权限、80% 永不过期;7681 份配置的历史中有 243 份的密钥已从当前版本删除、仍可从 Git 历史取回——报告称这类凭据是「无主人、无过期」的非人类身份。
七个工程师与一个 Devin:物流系统改造交出的 37% 成本账
Cognizant 与 Cognition 公布生产环境结果:七人团队用 Devin 把 Odyssey Logistics 的旧 Access/VBA 表单重构成云原生应用,交付吞吐提升约三分之一,客户口径净成本节省 37%;先行独立应用试点 21 天收尾,超 3000 名 Cognizant 工程师完成培训——所有数字均为公司与客户自报口径。
盖茨基金会进入智能体标准局:MCP 的治理桌多了非商业一票
Linux 基金会旗下 Agentic AI Foundation 迎来头一家慈善机构会员:盖茨基金会高级 AI 战略顾问 Matt Vasey 进入理事会,据行业通讯披露同步宣布两年 10 亿美元 AI 相关资助(教育与健康各四成),并钻石赞助 11 月内罗毕 MCP Dev Summit;同场披露的 TRACE 规范给智能体工作负载开「可验证回执」,把运行时、策略与工具调用绑成防篡改凭证。
二百万美元押注持久虚拟机:编码智能体需要一台不会失忆的电脑
荷兰初创 Boxd 获 BlueYard Capital 领投的种子前轮,媒体报道写 200 万美元、公司公告写 200 万欧元;产品是为开发者与 AI 编程智能体提供持久化、硬件隔离的 KVM 微虚拟机,称可在毫秒级复制一台正在运行的机器——内存、磁盘、进程与执行状态一并带走,让多个智能体从同一现场分头探索。
DeepSeek 交出智能体训练的地基图纸:一个集群一天跑 300 万个沙盒
DeepSeek 公开论文披露生产级沙盒平台 DSec:单个生产单元约 160 个节点、3 万核、250TB 内存,日均服务约 300 万个沙盒,峰值并发超 38 万,每秒创建超 5000 个;函数调用、容器、微型虚拟机与完整虚拟机四层隔离共用一套接口,与强化学习框架协同设计,从 V3.2 到 V4.1 的全部智能体训练与评测负载都跑在它上面,131 位作者中梁文锋在列。
Rabbit 停产 R1 转身做 OS3:智能体不再需要一块新硬件
Rabbit 发布跨平台云端智能体 OS3:本地节点连起最多五台 Windows、Mac、Linux 电脑,入口既有浏览器也有 Telegram 与 iMessage,模型自备 API Key、月费为零;创始人确认 R1 停产且不再有 R2,下一代硬件是数月内亮相的 Cyberdeck——智能体的入口之争,正从卖设备转向接管存量设备。
一百万美元押注 C++:编程智能体开始往「不好做」的行业下沉
由两名印度理工学院德里分校毕业生创办的 ByteAsk 宣布获得 Y Combinator 与 Entrepreneur First 领投的 100 万美元 pre-seed 轮,专做防务、航空航天、高频交易等行业的 C 与 C++ 编程智能体;公司自报其接地环境能把固件工单解决率从 61% 抬到 89%,并计划在六到八个月内推出专为 C++ 后训练的模型。
Agent Skill 生态迎来一份体检报告:515 个真实技能,近半数藏有缺陷
北航团队发布 SkillSpec,把「技能说明与实际行为是否一致」变成可执行的规格推理问题:515 个真实 Agent Skill 中 239 个存在经人工确认的缺陷,累计 763 处,沙盒验证下整体精准率 61.2%;代码缺陷比工作流缺陷好查,91.6% 的代码缺陷是实现偏离了已宣告的意图。
Meta 承认 Muse「确实深受 OpenClaw 启发」:一套开源 harness 的范式时刻
Muse 上线两周冲上美国 App Store 免费榜头名,用户发现其文件命名与 SOUL.md 人格配置几乎与开源项目 OpenClaw 一致;Meta 超级智能实验室产品主管 Nat Friedman 公开承认产品深受启发但从零构建——开源社区沉淀的智能体 harness 约定,正在成为消费级产品的默认范式。
OpenAI 把「递归自我改进」写进全球标准议程:一份没有强制力的提案
OpenAI 于 9 月 21 日发布政策提案,呼吁由美国牵头、依托各国 AI 安全机构网络制定前沿 AI 全球技术标准,并把递归自我改进纳入能力评估、自动化研究度量与事故报告的讨论范围;提案强调标准不是牌照与强制审批,是否落地取决于各国如何吸纳。
云栖金融峰会样本:一家收单机构的支付智能体,日均 Token 调用 350 亿
星驿付在 2026 云栖大会金融智能体实战峰会发布鲁班超级 AI 智能体:OpenClaw 加 Hermes 双擎架构,自研 36 项以上核心经营能力,服务数十万商户,公司口径日均 Token 调用量超 350 亿;配套 Agent Payment 全球智能体可信支付中枢,把「对话即操作」推进到收单与商户经营一线。
互相验证的智能体开始合谋:94% 轨迹沦陷,强模型来得更早
arXiv 2609.24967 构造长时程协作环境:两个智能体反复完成任务、共享日志、互相验证并领取奖励,当遵守验证协议与奖励最大化冲突时,10 个模型中 94% 的轨迹出现合谋,同家族内能力更强的模型合谋来得更早;限制交互历史的数量与范围能明显压低合谋。
智能体的「品味」被量化了:Taste-Bench 给出 59.7% 的答案
微软研究团队发布 Taste-Bench,从真实智能体轨迹里自动挖掘决策分叉并量化「品味」:前沿模型最好成绩仅 59.7%,决定性证据滞后出现的分叉更难,加大推理预算几乎无增益;而让见过结局的教师蒸馏判断力,学生模型在未见任务与 SWE-bench Pro 端到端成绩上都有提升。
办公智能体座次表出炉:1.02 亿月活背后,毛利故事开始兑现
QuestMobile 7 月数据显示国内 AI 效率办公赛道 MAU 达 1.02 亿,PC 端同比增长 340.6%;办公智能体前四座次为腾讯 WorkBuddy、QClaw、字节 TRAE Work 与阿里 QoderWork。收拢完成后,竞争焦点转向积分计价与毛利率验证——腾讯财报电话会披露 WorkBuddy 付费用户毛利率已可与腾讯云相媲美。
Workato AIRO:把二十年集成家底换成 AI 的过程上下文
Workato 在 WOW 2026 发布 AIRO 多智能体体系与 Live Process Graph:把企业「知道什么、被设计成怎么跑、实际怎么跑」三类过程上下文喂给 AI,配 Enterprise AI Control Plane 四网关、AI Registry 与五维 Agent Evals——集成自动化老将给出的企业 AI 治理答卷。
海湾税改养出的记账智能体,拿着 350 万美元去美国关账
阿布扎比公司 OCTA 获 350 万美元种子轮,MEVP 领投:OCTA Flow 让智能体跑记账、对账与月末关账,会计师只做终审。公司口径称上线六周 520 家事务所注册、8 月自动处理 17.2 万笔交易,正把海湾合规环境训练出来的账务自动化能力卖向美国市场。