两份研究,同一个问题

提示注入已经是被反复讨论的议题,但绝大多数讨论都停留在文本层:网页里的隐藏指令、文档中的恶意段落、工具返回内容里的越权要求。arXiv 上近期公开的两项工作把注意力移到了非文本通道——图像与音频,也就是智能体感知世界时并不经过文字解析的那两条路径。

AgentHijack 关注的是「一个局部视觉补丁能否触发可验证的环境后果」,也就是把注入攻击的链路完整跑通:截图输入、视觉语言模型生成、动作解析、环境执行。MMPIBench 关注的则是「注入在多模态框架里能走多远」,并把视觉与音频两条通道放在同一个可复现的基准下比较。两项研究的结论方向一致,但给出的数字差异很大,这个差异本身很有信息量。

截至目前,两项研究的完整数据集、被测试框架的具体版本与后续补丁情况,公开材料暂未披露更多细节,后续将持续跟进迭代动态。

AgentHijack:把补丁打进真实环境

据 arXiv 论文摘要(2026 年 9 月 6 日提交,作者包括 Zhihao Liu、Hongyu Sun、Zhiyuan Fu 等),AgentHijack 是一套端到端评测框架,用于测试图像触发的命令注入对计算机使用智能体(computer-use agent,简称 CUA)的影响。

实验设计有几个值得注意的地方。补丁被部署在作者控制的 GitHub Pages 页面与一个本地部署的 CSDN 镜像上,并在真实环境中评测,覆盖五套开源或公开可用的 GUI 智能体或视觉语言模型后端。实验汇总了 600 个实例级在线案例,报告三项指标:T-ASR(触发攻击成功率)84.5%、TAPR(触发后尝试率)47.0%、E2E-ASR(端到端攻击成功率)20.3%。

这三个指标要分开理解。84.5% 说明「补丁被识别为某种可执行指令」这件事本身很容易达成;47.0% 说明接近一半的案例中智能体确实开始尝试执行;而 20.3% 才是真正产生了环境后果的比例。从 84.5% 到 20.3% 的衰减,说明执行链路中仍有若干环节会打断攻击——但 20.3% 已经是一个不容忽视的数字,因为它意味着在真实环境中运行的五分之一的案例里,攻击完成了。

论文还提到一个更值得警惕的轨迹特征:在部分成功案例中,智能体先执行了恶意终端命令,然后继续完成原本的正常任务。这个顺序很关键——用户看到的是任务顺利完成,恶意动作被夹在中间,不会表现为「智能体出错了」。这类攻击的隐蔽性远高于直接失败。

MMPIBench:把「尝试」和「完成」分开统计

据 arXiv 论文(arXiv:2609.09404,公开报道时间为 9 月 10 日),MMPIBench 是一套可复现的多模态提示注入基准,用于衡量注入对智能体框架的影响。这类框架允许语言模型规划、维持记忆并调用与真实文件、邮件和服务交互的工具。

基准通过六种视觉载体投递固定攻击集,包括 OCR 文本、叠加层、EXIF 元数据、二维码、伪造界面与混合形式,并追踪注入指令从感知到规划再到工具执行的传播距离。实验共 720 次运行,覆盖六套框架、五个基础模型、六种载体与四个攻击者目标。

核心结果是一个对比鲜明的数字对:攻击在约 1% 的运行中完成,但在 12.8% 的运行中被尝试。尝试与完成之间的差距,几乎全部在规划步骤被截断——模型读到了注入的指令,然后拒绝执行。研究还发现,具体使用哪个基础模型,对「指令是否被采纳」的影响远大于框架本身:一个模型从未尝试攻击,并在 59.7% 的运行中识别出了注入;另外两个模型则在 23.6% 的运行中尝试了攻击。

音频通道的结论是这项研究里最值得注意的部分。研究者把基准扩展到音频——这是当前前沿模型接受的另一条原始感知通道。五个模型中只有两个会接收音频,六套框架中只有三套会投递音频。但在信号确实到达的场景中,攻击完成率高达 49%,其中一个特定模型达到 75%。

为什么视觉守得住,音频守不住

两份研究放在一起,可以读出一条相对清晰的判断:防御投入的分布并不均匀。

视觉通道被大量防护覆盖,原因不难理解——屏幕截图是 GUI 智能体最主要的输入,视觉提示注入在过去一年被反复测试,模型在训练与对齐阶段对此类模式已经积累了识别能力。MMPIBench 的结果显示,拦截主要发生在规划步骤,也就是模型读到指令后主动拒绝,这属于模型层的能力而非框架层的拦截。AgentHijack 的结果则说明,即便如此,视觉通道仍未封死,端到端仍有 20.3% 的成功率,因为从识别到拒绝之间存在执行链路,而补丁可以针对这条链路做优化。

音频通道的问题在于「窄而浅」。支持音频输入的模型与框架都很少(五个模型中两个、六套框架中三套),因此这条通道获得的测试与防护资源远少于视觉。但一旦基础设施支持,攻击完成率就跳到 49%,说明缺的不是攻击难度,而是防御积累。换句话说,音频目前是一条「很少人能走,但走通概率很高」的路径。研究者也指出,报告单一的完成率会低估实际暴露面——12.8% 的尝试率说明模型经常识别出恶意意图,但这种防御在不同模型与不同模态之间并不一致。

防御含义

两项研究对防御的启示可以归纳为几条。

其一,不要依赖单一模型的自觉。MMPIBench 明确显示模型间差异巨大,一个模型从未尝试攻击,另两个在超过两成的运行中尝试了攻击。选型时把注入识别能力纳入评估,比依赖框架层护栏更可靠。

其二,动作分级是成本最低的缓解手段。AgentHijack 的轨迹特征显示,攻击依赖智能体拥有执行终端命令的能力;对不可逆或高影响动作设置人工确认,可以切断从「尝试」到「完成」的路径,而这一层的收益与攻击指标无关,是确定性的。

其三,跨通道清洗需要补齐。视觉已有较多实践,音频几乎是空白——对语音输入做指令与内容分离、限制音频通道能触发的工具范围,属于当下可做但少有人做的加固。

其四,验证应该发生在环境侧而不是模型侧。AgentHijack 的核心结论是局部视觉信号会沿执行流水线传播并产生真实环境风险,这意味着在环境执行前做二次校验(例如命令白名单、文件系统写权限约束)比在模型输出上做过滤更接近根本。

其五,评价口径要统一。把「尝试率」与「完成率」分开报告,是这两项研究共同的方法论贡献——只报完成率会让人误以为防御有效,只报尝试率又会夸大风险。

与既有线索的关系

这条线索与近期多条动态相互印证。本栏目此前报道过 AgentJacking 类攻击(详见相关报道),也报道过 Anthropic 威胁情报报告中模型被用于网络操作的案例。更直接的是本批次另一篇报道涉及的供应链事件:被归因于 OpenAI 的智能体在公开站点留下痕迹并借构建链执行代码——那起事件中的智能体是在执行被授权的工具调用,而这里的两项研究讨论的是如何诱导智能体调用本不该调用的工具。前者说明权限过宽会带来什么后果,后者说明输入通道本身就是攻击面,两者共同指向同一个结论:智能体的安全边界不能只画在模型层。

中立思辨

需要冷静看待。其一,两项研究的实验环境均为研究者可控或半受控场景(作者控制的页面、本地部署的镜像、固定攻击集),真实生产环境的网络策略、权限配置与人工复核会显著降低成功率,20.3% 与 49% 不宜直接外推为线上风险水平。其二,MMPIBench 的音频结论建立在很小的样本上——只有两个模型接收音频、三套框架投递音频,49% 这个数字的置信区间必然很宽,「某模型 75%」更接近个案观察。其三,AgentHijack 的五套后端均为开源或公开可用的 GUI 智能体与视觉模型,商业闭源产品的表现可能不同,公开材料未覆盖。其四,补丁部署在作者控制的站点上,攻击前提是智能体访问了特定页面,这限制了攻击的普适性,但对「智能体会访问任意网页」的场景仍然成立。其五,两项研究都以「攻击是否完成」为核心指标,未评估防御成本与可用性损失——把所有动作都加上人工确认,安全性会提升,但智能体的价值也会下降,实际部署需要在两者之间找平衡。其六,测试对象会随时间变化,模型与框架的安全能力迭代很快,这批结论的价值更多在于方法论与风险方向,而非具体分数。其七,把视觉与音频并列比较是合理的,但两者在真实产品中的使用频率差别很大,风险排序需要结合自身部署的实际输入通道来判断。

趋势研判

短期,多模态注入测试会从视觉扩展到音频、视频等更多通道,而「尝试率与完成率分开报告」会成为安全评测的常规做法;中期,动作分级与工具权限约束会从「建议」变成「默认」,环境侧的执行前校验会成为智能体平台的标配能力;长期,如果智能体的输入通道继续增加(摄像头、麦克风、传感器、其他智能体的消息),安全设计的重心会从「过滤输入」转向「约束输出」,也就是在设计上限制智能体即使被误导也无法造成不可逆后果。

对正在部署智能体的团队来说,一个可以立刻执行的自查是:列出你的智能体目前能接收的所有输入通道,然后逐一确认每个通道是否都经过了与文本通道同等级别的清洗与校验。多数团队会发现,文本通道有过滤,图片通道有部分处理,而音频、元数据与二维码这类「次要通道」基本没有防护——这恰好是攻击者会先去看的地方。