如果要挑一个最不适合让 AI 试错的场景,保险的两核(核保与核赔)大概率排在前列。核保决定是否承保、以什么条件承保,核赔决定是否赔付、赔付多少——这两件事的容错率极低,模型的一次幻觉可能直接转化为资金损失,甚至引发合规争议。9 月 9 日的外滩大会「AI 重塑金融范式:可信 AI 与金融智能体前沿论坛」上,蚂蚁胜信(上海)信息技术有限公司董事长方勇分享的落地实践,恰好提供了一个观察「高容错要求场景如何用智能体」的样本。
先看清场景的约束条件
方勇在演讲中对场景约束的描述很直接:保险两核容错率极低,AI 幻觉将直接造成资金损失。这句话划出了这类场景与传统办公智能体的根本差异——办公场景里,一次错误的建议最多被忽略;而在两核场景里,一次错误的判断会直接变成一笔真实的赔付或拒赔。
这也决定了技术路线不能是「把通用模型接上知识库」。保险两核的判断依赖大量专业规则、条款细节与历史案例,通用模型缺少的正是这类高密度、强约束的领域知识。按公开表述,其应对方式是通过端到端 Agentic 架构配合「自提炼 Skills」,实现从通用 AI 向专业 AI 的跨越——把领域经验沉淀为可复用的技能单元,而不是寄望于模型自行掌握。
「自提炼 Skills」这个说法值得单独拆解
「自提炼 Skills」在技术上的含义,大致可以理解为:系统在运行过程中把重复出现的判断模式提炼成结构化的技能单元,供后续任务直接调用。它解决的是专业场景里一个非常实际的问题——专家经验往往以案例形式存在,散落在文档与人的脑子里,难以被模型稳定复用。
把它做成技能单元有两个直接好处。其一是可审计:每一条判断依据来自哪个技能、匹配了哪些条件,理论上可以被追溯,这在需要留痕的金融场景里不是加分项而是必需品。其二是可迭代:当业务规则变化时,更新的是技能单元而不是重新训练模型,迭代成本与风险都更低。从工程角度看,这是把「领域知识」从模型参数里挪到外部结构中的典型做法,与近年来 agent skills 化的整体趋势一致。
公开的两个准确率底线
据公开信息,该系统在核保准确率 97% 以上、核赔准确率 98% 以上的底线保障下,年协助处理数千万次咨询与近千万件理赔,为高风险金融场景的 AI 规模化落地提供了实践样本。
这两个数字需要放在正确的位置上理解。在金融场景里,准确率从来不是一个可以单独看的指标——一个 97% 的准确率意味着每 100 次判断中有约 3 次需要人工介入或存在风险敞口,因此真正决定系统能否上线的是「剩余部分如何处理」。公开表述中提到的底线保障,更接近一种工程承诺:把准确率作为不可突破的下限来设计流程,而不是把模型指标当作最终结果。
高容错场景的通用方法论
把这份实践抽象出来,可以得到一套在高容错要求场景里通用的落地方法。
其一,把「准确率」转化为「流程约束」。与其追求模型单点更准,不如设计成「模型判断 + 规则校验 + 人工复核」的分层结构,让错误在流程中被拦截,而不是依赖模型不犯错。其二,把领域知识外置为可审计的结构。技能单元、规则库、案例库的存在,让判断过程可回溯,也让责任可以被界定。其三,把人工复核放在正确的位置。在人机协同里,人工不该承担全部工作,也不该只是形式上的签字;合理的分工是让模型处理高置信度的常规件,把低置信度与例外情形交给人工——这恰恰是价值最高的部分。其四,用底线而非均值来定义上线标准。均值会掩盖长尾,而金融场景的损失几乎全部来自长尾。
中立思辨
需要辩证地看待几个方面。其一,企业公开表述的准确率数字,其统计口径、样本分布与验证方式目前尚未完整披露,不同险种、不同地区、不同案件复杂度下的表现可能存在明显差异,把单一数字当作通用结论并不严谨。其二,「自提炼」机制带来一个需要警惕的副作用:如果错误模式也被提炼进技能单元,偏差会被固化并规模化复制,因此需要配套的校验与回滚机制。其三,年处理数千万次咨询与近千万件理赔的规模,意味着系统已深度嵌入业务流程,一旦出现系统性偏差,影响的量级也会同步放大,这对监控与应急处置能力提出了高于一般系统的要求。其四,此类系统在提升效率的同时,也可能压缩一线专业人员的判断空间,长期看是否会影响经验积累与人才结构,目前尚无定论。其五,具体的模型选型、部署形态与人工介入比例,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
趋势研判
短期,金融领域的智能体会继续沿着「先辅助判断、后承担动作」的顺序推进,因为机构对准确率的要求远高于对自动化率的追求;中期,随着技能单元与规则库成为可复用资产,同一套架构有机会从保险向信贷、风控等相邻场景迁移,迁移的难点不在模型而在领域知识的结构化成本;长期,金融智能体的竞争力会体现在「可审计的专业能力」上,也就是能不能把每一次判断的依据说清楚——在一个需要留痕的行业里,能被解释的能力,比更准的能力更稀缺。
对准备进入类似场景的团队,建议从一个规则明确、案件量稳定、错误可回退的环节起步,先跑通「模型判断 + 规则校验 + 人工复核」的最小闭环,并把准确率底线与人工介入比例写成可量化的运营指标,再谈扩大范围。高容错场景里的效率,从来是安全换来的,而不是相反。