单库向量检索,为什么到顶了

过去做智能体记忆,多数团队的本能反应是「把对话摘要塞进向量库,需要时语义检索」。这套做法对简单事实问答够用,但长程智能体跑起来就露怯:它要记的不只是「说过什么」,还有「什么随时间变了」「谁和谁有关联」「哪些是已经坐实的事实」。把这几类信息硬塞进同一个向量空间,检索既抓不准时间顺序,也答不好关系问题,还会在数据库变大后因为噪声过多而拖垮推理、抬高成本。2026 年下半年,几篇记忆论文不约而同地把矛头指向这个单结构假设。

Agent Zero Memory:三段并行,每条事实带溯源

8 月 30 日,Ming Wu 与 Pengyuan Zhu 在 arXiv 提交 Agent Zero Memory(编号 2608.29606)。它的核心赌注是:记忆不该是一个通用仓库,而该是三段并行、各司其职的结构——情景记忆记事件时间线、关联记忆用实体事件知识图连人连项目、语义记忆存经过审定锁引的稳事实。检索经意图门、来源路由与多次智能体搜索组合完成。更关键的设计约束是:每条被记住的事实都必须带着来源、时间戳与证据指针;系统宁可 abstain(拒答),也不编一个查无实据的答案。论文在 LongMemEval 拿到 95.60%、在 LoCoMo 拿到 93.60%,并对八个不同模型骨干做成本分析:准确率只差 3.4 个点,而单次查询成本差约 30 倍。

这个「溯源优先」思路点中的是长程智能体更致命的失败模式:一个被说过一次、却无从查证的断言,会被记忆系统当成既成事实反复引用。把拒答做成一等公民,比单纯追召回率更贴近生产需要——因为基准测不出「智能体自信地依据假记忆行动」的真实代价。

MRAgent:把检索嵌进推理循环

新加坡国立大学团队提出 MRAgent,走的是另一条路:主动记忆重建。它不采用「先一次性向量检索、再把块喂给模型」的被动管线,而是把记忆检索直接嵌进语言模型的推理循环——智能体随着证据积累,逐步构建并精炼自己的上下文。论文称在复杂推理任务上带来最高 23% 的提升,同时大幅削减 token 消耗与运营成本。其灵感来自人类记忆重建:回想不是整文件下载,而是从微小线索出发、沿关联一步步找回并校验。对跨多个迭代的软件调试、跨年度的财务审计这类证据分散的场景,主动重建比一次性相似度匹配更能把断裂的事实连起来。

MEMTIER:分层巩固,高频事实晋级语义层

MEMTIER(Sidik 与 Rokach,2026)给出第三种答案:分层巩固。它用一个只追加的情景 JSONL 存原始观测、工具调用与结果,再跑一个异步巩固守护进程——当某条记忆被跨多个不相关触发反复检索时,把它提升进更小的语义层。语义层不是预先填满的,只积累被观察为「已泛化」的条目。配套的五一加权检索(相关性、时效、结果、频率、结构兼容)与基于注意权重的认知权重环,让高价值稳事实不必每次都和上千条原始观测竞争。论文在 LongMemEval-S 上用 Qwen2.5-7B 报告 38.2% 准确率,比全上下文基线高 33 个点,且只需 6GB 消费级显卡。需要提醒的是,基线很弱,真实相对一个调好的 RAG 系统的优势没标题那么夸张;论文仍是预印本、未被复现,架构可信、数字需谨慎。

三条路线合起来回答了什么

把这三篇放在一起看,方向是一致的:记忆从「一个能搜的库」变成「多结构协同的系统」。Agent Zero Memory 解决「记错怎么办」——用溯源与拒答把幻觉挡在门外;MRAgent 解决「一次检索不够」——用主动重建在推理中逐步找回;MEMTIER 解决「库变大就稀释」——用分层巩固把高频事实提权。三者分别补强了可信度、召回质量与规模效率,恰好覆盖长程智能体记忆的三道坎。

落地取舍:何时上框架,何时自己写

对工程团队,共识很实用:任务窗口超过一两天、且任务结构反复出现,分层与巩固才划算;会话短、规模小,一个带嵌入索引的扁平 JSONL 加周期性摘要就够。记忆条目该有生命周期而非单一当前值——被取代的旧事实留着审计、标记当前状态、写明「为什么新事实覆盖旧事实」。需要跨租户隔离时,语义层天然适合放溯源与剪枝策略。多数团队不必从零造轮子:Mem0、Letta、Zep 这类记忆框架已覆盖抽取、去重、对账的大部分工作;只有当对账与去重逻辑开始吃掉大量工时,才值得自研。

结语

2026 年的智能体记忆研究,正把「能检索」推向「能溯源、能重建、能分层」。Agent Zero Memory 用溯源把可信度钉死,MRAgent 用主动重建把召回质量拉高,MEMTIER 用分层巩固把规模效率做出来。对正在把智能体铺进生产的团队,记忆不再是「接个向量库」那么简单,而是一块需要按窗口长度、任务重复度与隔离要求认真设计的系统工程。先把生命周期与溯源写进默认模板,再谈框架选型。