在智能体的工作流里,文档往往是最脏的一环:PDF 版式千奇百怪,表格跨页、印章叠字、手写批注混在一起,模型读错一行,下游的判断就可能整体跑偏。9 月上旬,吴恩达创办的 LandingAI 发布第二代智能体文档抽取产品 Agentic Document Extraction Gen2(简称 ADE Gen2),把底层模型换成全新的 DPT-3 家族,并重做了输出结构与计费方式。官方把它概括为三个关键词:可负担、面向智能体的输出、原子级溯源。
变化一:计费逻辑从「按页」变成「按输出字符」
据官方博客与迁移文档,ADE Gen2 在定价上做了一次方向性调整。上一代 DPT-2 是每页固定 3 credits,无论这一页是寥寥数行的封面,还是排满小字的财报附注,价格都一样。Gen2 改为「页面分量 + 输出字符分量」的复合计费:在 Priority 档位下,DPT-3 Pro 为每页 1 credit 加每 1000 输出字符 0.5 credit;DPT-3 Verity 为每页 0.3 credit 加每 1000 输出字符 0.2 credit。Standard 档位是 Priority 的 0.5 倍,代价是异步返回,适合能接受分钟到小时级延迟的生产管道。
官方给出的例子是:一次 12 页的 Pro 解析、返回 48,120 个字符,在 Priority 档位下约 36.1 credits,在 Standard 档位下约为其一半。LandingAI 称,在混合负载下整体成本预计下降 25% 至 80%;使用 Verity 加 Standard 档位处理典型商业文档,单页成本可低于一美分。
这套计费背后的逻辑值得拆开看。按页收费会惩罚内容稀疏的文档、补贴内容密集的文档;按输出字符收费,则把成本与「实际产生了多少可用信息」挂钩。对大量处理扫描件、单页表单的业务,成本会明显下降;但对动辄上百页、字字密集的财报与合同,字符分量的权重会上升,未必比过去便宜。换句话说,这是一次成本结构的重新分配,而不是单向降价。
变化二:文档从「扁平列表」变成「树」
据官方说明,Gen1 把文档处理成一串扁平的 chunks,丢掉了版式、阅读顺序,以及「抽出来的字段来自哪里」这层关系。Gen2 把文档建模成一棵树:文档节点下是页面,页面下是带类型的 blocks。block 类型包括 text、table、table_cell、figure、marginalia、attestation、logo、card、scan_code。每个 block 带一个语义 ID(形如「类型-序号」,在同一次响应内稳定,但跨重新解析并不保证一致),以及一个 grounding 对象——记录页码、在 markdown 字符串中的区间,以及归一化的边界框。
markdown 输出也做了标准化:图片类内容用 style 元素承载,生成的描述被隔离在特定标签内,避免把「模型补写的说明」误当成「原文转录」;印章类内容输出为堆叠标签,例如 [STAMPED][SIGNED],无法辨识的签名与文字用固定字面量 [ILLEGIBLE_SIGNATURE]、[ILLEGIBLE_TEXT] 表示;表格默认以 HTML 输出,以保留合并单元格。
这套结构对下游智能体的意义,比它看起来更大。当输出是可遍历的树而非一串文本,Agent 就能按需读取某一页、某一张表、某一段边注,而不是把整份文档塞进上下文。这与当前上下文工程的主流思路一致:用结构化句柄替代全量搬运。
变化三:原子级溯源,让「字段来自哪里」可定位
据官方说明,Gen2 最实质的能力是原子级溯源。每个叶子 block 都带一个 atomic_grounding 数组:DPT-3 Pro 为每一视觉行给一条记录,DPT-3 Verity 则为每一个词给一条记录,并附带 0 到 1 的置信度(取该词中最低的单字符得分)。表格单元格现在也带自己的边界框,不过 Pro 在单元格级别的原子溯源上留空。
Extract V2 的引用正是从这个溯源结构里生成的,因此一个抽取出来的字段可以追溯到某一页的某一个词。官方称,这让「按坐标做脱敏」「文档差异比对」「审阅界面」从近似可行变成可以工程化实现。举一个具体场景:合同里的金额字段被抽错时,系统可以指出它来自第几页哪一行;对低置信度的词,可以路由到人工复核,而不是让不确定的转录继续往下游流。
怎么选、怎么迁
据官方说明,Gen2 把解析拆成两个模型,由任务复杂度决定用哪个。DPT-3 Verity 面向数字原生文档,做确定性转录,逐词给出边界框与置信度,适合高吞吐的结构化文本、表格与简单表单字段;DPT-3 Pro 先读版式再读字,能识别表格、图、边注、签章等 block 类型并按阅读顺序返回,还能处理扫描页、手写、非拉丁文字与 LaTeX 公式,溯源到行级。Verity 的 credit 消耗约为 Pro 的 40%。官方称两个模型之间的自动路由计划在 2026 年秋季推出。部署方式包括美/欧云、客户自有 VPC(AWS、Azure、谷歌云)、Snowflake,以及本地与气隙环境。
迁移上有一条硬约束需要注意:Gen1 的客户端代码与 Gen2 端点不兼容,集成代码需要按新的 Parse v2 响应结构重写,不能假设向后兼容。此外,同步调用始终按 Priority 计费,官方 Playground 也运行在 Priority 档位——这意味着开发者若只在 Playground 里试,看到的并不是 Standard 档的价格。
中立思辨
需要辩证看待这次升级。其一,25% 至 80% 的成本降幅是厂商估算,不同文档组合下的实际结果差异很大,尤其是字字密集的财报与法律合同,字符分量可能把成本推高到高于上一代的水平,落地前应先用自己的文档组合做基准测试。其二,按字符计费意味着成本模型需要重建,过去按页估算预算的方式不再适用,财务与工程侧都要重新对齐口径。其三,原子级溯源解决了「来源可查」,但没有解决「来源正确」——溯源只能告诉你字段来自哪一行,不能保证这一行被正确理解,尤其在扫描件与手写场景。其四,语义 ID 在同一次响应内稳定、跨重新解析不稳定,这个设计对增量处理与缓存策略有影响,需要在上层做额外映射。其五,Pro 在表格单元格级溯源上留空,说明「原子级」在不同模型间并非同一粒度,选型时要以实际字段需求为准。其六,DPT-3 Verity 尚处公开预览阶段,自动路由也尚未上线,当前的能力边界与最终形态之间还有距离,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。其七,把 AI 智能体当作「主要用户」来设计 API,方向是对的,但这也意味着输出结构一旦调整,依赖它的下游工作流就要跟着改,版本兼容策略会成为长期成本。
趋势研判
短期,文档抽取的竞争会从「识别准不准」转向「成本能不能算清、来源能不能追溯」;中期,随着原子级溯源成为标配,围绕坐标的脱敏、比对、审阅会形成一批新的上层应用;长期,文档解析会从独立服务逐步退居为智能体工作流的隐形底座——用户不再关心它用了什么模型,只关心字段能否被信任、出错能否被定位。谁能把「可追溯」做成默认能力,谁就更可能留在生产管道里。