大模型「记不住」的老毛病,正在被数据库层正面解决。7 月 19 日 WAIC,星环科技发布 GPU 原生认知数据库,宣称专为 AI Agent 高频数据访问场景设计,性能较 CPU 方案快 20 至 100 倍,内置长期记忆与会话记忆(准确率超 90%),TPC-DS 基准对比 Snowflake、Databricks 性能提升 66 倍。这背后是一条清晰逻辑:Agent 要「能干成事」,先得有一个能跟得上它思考速度、还不会忘事的「记忆底座」。

一、痛点:Agent 的瓶颈不在脑子,在「手边资料」

当前多数智能体受困于数据访问——它们能推理,却要在海量、异构、分散的数据里反复检索,慢且易错;更尴尬的是「记忆」:上下文窗口有限,跨会话后前情尽失,要么靠 RAG 临时翻档案,要么靠超长上下文硬撑,成本高、稳定性差。星环的判断是,与其不断给模型加长上下文,不如在基础设施层给 Agent 配一套「原生记忆」:数据常驻 GPU 显存,按需被瞬时调用。

二、解法:数据库整体搬上 GPU

据披露,该数据库将存储与计算统一到 GPU 之上,成为「GPU 原生」的认知数据库,面向 Agent 高频、低延迟的数据访问做了重设计。其内置长期记忆与会话记忆两套机制,长期记忆沉淀用户与业务的稳定知识,会话记忆保留当前任务上下文,官方披露记忆相关准确率超 90%。在 TPC-DS 这一数据仓库权威基准上,相较 Snowflake、Databricks 取得 66 倍性能提升;整体相较 CPU 方案快 20 至 100 倍。对动辄要查库、调档、比对的多步 Agent 而言,这意味着「想」和「取」的延迟被压缩到接近同频。

三、坐标:记忆基础设施赛道升温

星环的举动并非孤例。今年以来,Agent 记忆层成为热门赛道:既有 EverMind Raven 以双向记忆内化把 Agent 推向 L3 自进化,也有 MemOS、MemTensor 等记忆架构尝试把「记得住」工程化。区别在于落点——Raven 等偏重 Agent 自身的记忆操作系统,星环则把记忆沉淀进数据库这一最底层、最通用的基础设施,让任意 Agent 都能即插即用地获得稳定记忆与高速数据访问。路径不同,目标一致:让 Agent 告别「转头就忘」。

四、客观看:性能数字亮眼,落地仍看真实负载

66 倍、20 至 100 倍这类数字很提气,但客观评估需注意:基准测试的负载特征与真实业务千差万别,TPC-DS 衡量的是决策分析型查询,能否平滑迁移到 Agent 复杂的多源、多模态、强一致访问,仍需更多生产验证;GPU 常驻显存亦带来成本与容量权衡。方向无疑正确——把记忆与数据访问做成基础设施,是 Agent 从「演示」走向「系统」的关键一环。但数据库层的「Agent 化」竞赛,才刚刚开场。