主流大模型还在沿着自回归路线一路扩展,另一条技术路径却在端侧悄悄逼近了产业化临界点。9 月 1 日,扩散语言模型团队扩散智能 DiffuSpace 与亚洲智能体计算平台公司 Acrab 宣布达成战略合作,将共同推进 dLLM 在 AI PC、智能汽车、机器人与智能家居等端侧场景的落地。
双方给出的适配测试数据是:dLLM 可将端侧 Agent 的运行速度提升约 5 倍。DiffuSpace 方面还表示,在部分场景中,其推理速度可以达到 GPT 式自回归模型的 10 倍。
一、先整体生成,再不断修正
要理解这个数字,得先看两种生成范式的差别。GPT 类自回归模型的做法是「从左至右、逐个 Token」——一个字一个字往外蹦,每一步都依赖上一步的结果。dLLM 则借鉴了图像生成领域的扩散机制:生成时先形成一个全局内容框架,再结合上下文并行地不断修正结果。类比一下,前者像逐字书写,后者像先起草全文再反复改写。
差别在端侧会被放大。自回归模型每次只产出一个 token,无法高效利用端侧芯片的并行算力;而扩散语言模型可以把多个位置同时交给 GPU 处理,把芯片的并行计算能力实实在在转化成速度。
Agent 场景进一步放大了这件事的重要性。一次完整的 Agent 任务往往包括规划、检索、工具调用、执行与校验,模型会被连续调用多次——每一次生成带来的延迟,都会在整条任务链路上累加。因此 5 倍的单次提速,反映到端侧 Agent 完成任务的总耗时上,是个会被放大的收益。
二、两个测试场景:写代码与剪视频
在 Acrab 的参考设计里,Coding Agent 是核心测试场景之一:dLLM 可以并行处理多个代码位置,从而提升代码生成与修改的效率。另一个场景是视频剪辑智能体——由于需要同时处理图像、语音与文字,dLLM 的全局建模能力被用于多模态任务的协同处理。
还有一个更贴近日常的例子:当本地 Agent 需要同时读取邮件、整理日程、检索文件并生成后续计划时,传统自回归模型需要逐步生成、依次执行,而扩散模型可以对多个相关步骤并行推演,并根据变化实时调整,完成多个任务之间的动态耦合。
这次合作释放的关键信号其实不在速度本身,而在协同方式:dLLM 与端侧计算平台的结合,不是简单地把一个模型塞进芯片,而是围绕 Agent 的工作负载,做模型、算力与应用场景的三方协同适配。这背后对应的是端侧 Agent 正在面对的一组现实约束——实时响应、计算效率,以及有限算力下的运行速度。
三、谁在做这件事
DiffuSpace 是全球最早投入 dLLM 范式研究的团队之一,由港大 NLP 实验室联合主管孔令鹏教授及其博士生龚珊三、叶佳成联合创立,核心成员来自清华、北大、港大、CMU 等高校与模型团队。团队的学术脉络相当清晰:2022 年推出 DiffuSeq,开创了用扩散模型处理序列到序列文本生成的技术路径;2025 年推出的 Dream 7B 模型,在同等参数规模下超越了自回归模型。团队自称是全球唯一在「条件生成、离散信号建模、Scaling」三大 dLLM 核心问题上均有领先突破的团队——需要说明的是,这是团队自述口径,尚无可比的第三方评测佐证。
合作方 Acrab 成立于 2024 年,主要研发端侧 AI 芯片及智能终端,累计融资超过 4.8 亿美元,已进入产业量产阶段。这家公司定位是「亚洲智能体计算平台」,此前已在端侧 Agent 计算方向布局,被认为是当前适配优势较明显的芯片平台之一。
赛道本身也在升温。今年以来,Google、Inception、蚂蚁集团等企业均已推出各自的 dLLM 通用模型。业内甚至出现了「扩散语言模型或将在两年内替代 GPT 类自回归模型」的判断——这属于业内预测,不是已发生的事实。
四、客观看:从能跑到好用,还隔着一条生态
需要给 5 倍这个数字划三条边界。首先,它来自双方联合适配测试而非独立第三方基准,具体的测试负载、模型规模、硬件配置与对比基线均未完整披露——这类数字更适合当作方向性证据,而不是可复现的性能承诺。
其次,从「技术可行」到「生态可用」之间还隔着很长一段:算子支持、推理框架、量化方案、工具链适配,乃至开发者既有的提示词与工作流习惯,都需要重建。自回归阵营并非原地踏步,KV Cache、投机解码、各类量化与蒸馏方案仍在持续压低延迟——这是一场移动靶的竞赛,不是一次性的代差。
最后,扩散范式在长程一致性、复杂推理链上的表现,目前公开的可比证据仍然有限。Agent 任务恰恰对这两点要求很高。
不过方向值得关注。长期以来,端侧 Agent 的瓶颈被默认归结为「模型不够小」,行业的主要解法是压缩参数与量化精度。dLLM 提供的是另一条思路:不改变模型规模,而是改变生成方式,再叠加端侧芯片本来就具备的并行算力。如果这条路走得通,端侧 Agent 的能力天花板可能不取决于你能把多大的模型塞进设备,而取决于你能让它以什么方式思考。至于这个「如果」能否兑现,要看接下来 12 个月里有没有第三方跑出可复现的基准数据。