10 月 1 日,LlamaIndex 推出 Extract v2.5:一套基于 schema 的文档抽取智能体。官方给出的方向很实在——三个档位的抽取准确率全部抬升,而每页价格一分没涨。对每天要把大量发票、表单、招股书、基金文件喂给智能体管线的团队来说,这件事比又出一个通用聊天模型更贴近生产:它改的是「非结构化文档怎么变成结构化、可溯源的数据」这条常被忽略的底座。
背景:抽取是智能体数据管线的头一道关
一个跑起来的检索增强智能体,上游往往卡在文档解析。过去常见的做法是正则加模板,遇到版式一变就崩;或者干脆在生成时让大模型现抽,结果是慢、贵,而且抽出来的值往往找不到出处,审计和复核都难受。企业真正想要的,是「按我给的字段把这份 PDF 抽成结构化 JSON,并且每个值都能点回它在原文里的位置」。Extract 这条产品线从一开始就把目标定在 schema 驱动的抽取智能体上,v2.5 是把这件事往前推的一步。
新 harness:把编程智能体的打法搬进抽取
v2.5 跑在一套为文档抽取新写的智能体 harness 上,官方明说灵感来自近来的编程智能体,并围绕模型把视觉、推理、校验三类失败模式都调过一遍。关键改动有两处。其一是 Structural Reasoning:智能体不再对每份文档平均用力,而是先按文档类型、版式与信息密度做结构推理,复杂文档多花算力、简单文档低延迟处理。其二是 Advanced Citations(高阶两个档位才有):给每个抽出的字段定位到原文的证据框,哪怕这个值在文档里不是逐字出现,也能指回去。等于把「抽出来」升级成「抽出来且能点回原文」。
数字:三档全线提升,长列表不再漏
在 LlamaIndex 自家的公开基准 ExtractBench 上,价值 F1 三档一起涨:廉价档从 87.1 升到 93.9、反超了旧的中档,中档从 89.8 升到 95.8、反超了旧的顶档,顶档 Agentic Plus 从 95.1 升到 96.4。长列表这类最容易让前沿视觉语言模型过早收尾的任务,廉价档从 82.0 升到 92.6。一个很有说服力的例子是 17 页的基金文件:旧廉价档只抽回了 238 条持仓里的 87 条,新档抽回全部 238 条,整份文档的抽取分从 52.8 升到 98.7。跨页续写的记录、扫描表单也都有类似改善。
为什么值得写:可信抽取改变的是审核这一步
把这篇和智能体落地的主线连起来看,它的增量不在「又准了一点」,而在「准且能溯源」。当一个字段旁边带着原文证据框,人工审核从「对着 PDF 重新手敲一遍核对」变成「点开看一眼就批准」,复核成本的数量级就变了。对把大量票据、凭证、监管文件接进 agent 的团队,这种带引文的抽取直接决定了「人要不要一直跟着 re-type」。在 Agentic RAG 的架构里,它处在最前面的 ingestion 层,却影响了整条链路的幻觉率与可审计性。
边界:基准是厂商自家的,先拿自己的文档复一遍
需要冷静看待的是,ExtractBench 是 LlamaIndex 自己的基准,虽已公开数据集、评测脚本与方法论,但上升幅度来自厂商自报,落到你那 50 份真实发票、装箱单、采购单上未必是同样的 delta。更实在的建议是:先在自己的真实文档上把廉价档跑一遍,和人工核对的答案键对比,再决定要不要升档——尤其 Advanced Citations 只在两个高阶档位提供,而它恰恰是最值钱的增量。不要被「全线提升且没涨价」一句话带跑,把自家文档当成真正的验收集。
结语
Extract v2.5 的意义,不在于又多了一个文档解析工具,而在于它把智能体数据管线的头一道关从「抽出来」推进到「抽出来且可溯源」。当企业智能体每天吞下成千上万份文件,这种带证据框的抽取,很可能成为 agent 能否真的让人放心上线的一块隐形地基。