Arm 在近期技术大会上发布 CSS for Mobile 2,配套 C2-Ultra 的 AI 性能较前代提升约七成,小语言模型推理提速最高七成,并同步给出 Neoverse CSS N4 与面向 AGI 的 CPU 路线。表面是 IP 迭代,实质是端侧 Agent 的算力与内存底座正在加速成形——当手机、PC 的本地 AI 性能足以支撑常驻智能体,Agent 的竞争单位正在从模型参数转向「OS 调度权 + 硬件入口」。
阶段赛道总览
过去一年,端侧 Agent 的讨论集中在模型侧:哪家小模型更强、量化更狠、上下文更长。但模型再强,也要跑在芯片与系统调度之上。CSS for Mobile 2 这类底层平台的意义,是把端侧推理的「地板」抬高——更宽的带宽、更大的共享内存、更友好的 NPU 编程模型,让中小参数 Agent 能在本地稳定常驻,而不是每次都往云上跑。
多事件横向归纳共性
把高通新一代 Hexagon NPU、苹果 Neural Engine、联发科 APU 与本次 Arm 的路线放在一起看,共性很清楚:都在围绕 Transformer 与稀疏 MoE 做专用加速,都在抢「端侧长上下文 + 低功耗常驻」这两件事。大家殊途同归地认为,未来大量轻量 Agent 行为会留在设备本地,只有重检索与复杂规划才上云。端云协同,而非纯云或纯端,成为主流判断。
赛道新旧变化对比
旧范式里,端侧 AI 是「锦上添花」的离线补充,主力推理仍在数据中心;新范式里,端侧成为 Agent 的默认运行平面之一,云端退化为「重算力后援」。变化背后是两类压力:一是隐私与离线可用性要求把数据留在本地,二是推理调用频次爆发让纯云端成本与延迟难以承受。硬件底座的成熟,正在把这种架构从设想变成可量产方案。
核心矛盾总结
矛盾在于体验与功耗的永恒拉扯:端侧算力越强,电池与散热压力越大;NPU 加速越专用,模型适配与工具链碎片化越严重。对开发者,不同厂商的算子库、量化格式、调度接口各不相同,写一次端侧 Agent 要适配多套后端,迁移成本不低。此外,端侧模型更新与 OTA 机制若没管好,Agent 行为会随版本漂移,带来难以排查的回归。
未来趋势推演
短期,会出现更多「端侧轻 Agent + 云端重编排」的混合框架,厂商比拼的是系统级协同而非单核峰值;中期,端侧 Agent 会下沉到更多设备形态,从手机 PC 扩展到车机、眼镜、家电,Agent 的入口之争从 App 商店转移到 OS 与芯片层;长期,谁能定义端侧 Agent 的调度标准与权限模型,谁就掌握下一代分发的隐形入口。对开发者,建议先把哪些步骤必须上云、哪些可本地切分清楚,再选与目标芯片做了算子适配的模型,避免参数够但跑不动的尴尬。