企业知识库最大的痛点,往往不是「AI 不会答」,而是「AI 根本没找到资料」。一个问题答案可能藏在一份 300 页年报的第 187 页、一张表格里,或是一本 600 页说明书的某张流程图中。传统方案先把 PDF 抽成文字再向量检索,一旦遇到表格、图表、双栏排版、工程图,版面信息就被拆碎了。9 月 7 日,腾讯开源的 EVIE 直接换了一条路。

一、路线切换:跳过 OCR,直接理解整页

EVIE 的全称是 Evidence-Vector-Informed Embedding(证据向量增强嵌入)。它不再把 PDF 先 OCR 成纯文本,而是把整页当作视觉内容直接「看」:文字、表格、版式、图表、小字号都是输入的一部分,再变成可检索的多向量。检索时衡量的是「整页与问题有多相关」,而非「页面里是否出现某几个关键词」。对满是图表和扫描件的企业文档,这种「看懂整页」的能力,比关键词匹配贴合得多。

二、成绩:ViDoRe V3 66.75,多向量晚期交互第一

在腾讯公开的 ViDoRe V3 对比中,EVIE-8B 拿到 66.75 nDCG@10,EVIE-4.5B 拿到 66.02,排在 NVIDIA Nemotron-ColEmbed-VL-8B-v2(63.54)、webAI ColVec1.1-8B(65.32)等一众视觉文档检索模型之前,居多向量晚期交互模型首位。EVIE 基于阿里 Qwen3.5 搭建(ColQwen3.5 配置),一个中国开源实验室站在另一个中国开源实验室的底座上——这种「互为底座」的生态现象,本身就很值得记录。

三、工程巧思:HAC 压缩 + Prefix-MRL 把索引打下来

晚期交互的软肋一直是存储:一页文档会变成约 750 个向量,百万页就是一笔不小的索引账。EVIE-4.5B 从两个方向破题。其一是 HAC(层次化聚合聚类),免训练把每页 token 从约 750 压到 32 个向量,将索引存储降到每百万页 3.81 GiB;其二是 Prefix-MRL,单次 2048 维投影可在运行时截断到 64/128/256 直到 2048 维,无需另存多个模型,在 128 维时仅损失约 0.75 个点。换句话说,它不仅冲榜,也在认真考虑「能不能真跑起来」。

四、为什么是腾讯做、又站在阿里底座上

腾讯自身就有企业微信、腾讯文档、腾讯云知识库、客服与办公 AI 等大量「海量文件找答案」的场景,EVIE 瞄准的正是企业内部的信息入口。而以 Qwen3.5 为底座,则印证了国产开源模型之间的相互借力:当底层基座足够好,竞争优势就转向「在垂直任务上的工程与数据」。当然要严谨地说,上述分数均来自腾讯公开的模型卡与评测协议,尚未被第三方独立复现,ViDoRe V3 也只是复杂企业文档检索的专项榜单,不宜直接泛化为「通用搜索最强」。

EVIE 不会像聊天模型那样刷屏,因为它不聊天、不写诗、不生成视频,只干一件不起眼却极痛的事:从百万页资料里,把正确的那一页找出来。而企业最头疼的知识管理难题,很多时候恰恰就是这件事。