多 Agent 系统里「看起来在把关」的治理层,漏洞常常不在你正盯着的地方。9/10 的 AI Agent Arxiv Digest 三篇论文,恰好指向同一个反直觉结论。
一、问题背景
当多个智能体协作、且部分具备自主权限时,我们本能地会加一层「审计」:让某个 Agent 或模块检查其他 Agent 的结论。但这类治理层真的能抓到错误吗?
二、机制原理通俗拆解
三篇论文分别给出信号:其一,读取 Agent 自填报告的稽核层,在没人主动提出真正起因时,只能抓到约 4.1% 的正确归因——它看的是 Agent 自己写的总结,而非底层事实;其二,授权信息如果存放在 Agent 看不到的执行环境里,光让 Agent 看更多证据没用,真正挡下不安全动作的,是执行那一刻的权限检查;其三,完全没有治理机制的 Agent 群体,靠「照着眼前看到的比例复制」这条最廉价规则,也能长出一整套共同惯例。
三、工程取舍与局限性
这说明「可问责性」真正的问法不是「Agent 说它做对了吗」,而是「稽核机制读的是 Agent 的结论,还是独立于 Agent 之外的原始证据」。前者勾了等于没勾。把校验下沉到执行时刻(runtime policy enforcement),比依赖 Agent 自陈可靠得多,但代价是需要在执行层统一埋点,工程改造成本不低。
四、开发者适配建议
其一,治理层与执行层分离,权限校验下沉到 runtime 而非提示词层;其二,日志留存原始证据(调用参数、返回、环境状态),而非仅留 Agent 摘要;其三,多 Agent 委派必须留痕,靠「最廉价规则」自发收敛的惯例不可依赖,需显式约束。该笔记也呼应近期「异常优先」检测思路:先找与正常轨迹不同的地方,再判断是否错误,而非为每个新失败加规则。