瓶颈换了个位置
过去两年关于端侧 AI 的讨论,指标基本围绕算力展开:多少 TOPS、能跑多大的模型、每秒生成多少令牌。这套指标体系在「一次问答」的场景下是合理的,因为任务短、上下文小、模型驻留时间有限。
但当工作负载从问答变成智能体之后,指标的含义就变了。智能体要做的是规划任务、调用工具、检查结果、持续执行。一条工作流可能同时需要一个大模型做推理、一个多模态模型读图、一套检索索引撑着知识库,还要为长上下文预留键值缓存。这些需求争夺的是同一块内存。
AMD 在 9 月 10 日于北京举办的媒体沙龙上发布锐龙 AI Max PRO 400 系列,把升级重点放在内存容量而不是算力峰值上,正是顺着这个变化来的。按公开材料,该系列支持最高 192GB 统一内存,其中最高 160GB 可分配为显存;相比上一代产品,统一内存上限从 128GB 提高到 192GB,可承载的模型参数规模从 2000 亿扩展到 3000 亿。
统一内存到底改变了什么
要理解这次升级的分量,需要区分两件事:装得下和跑得快。
传统 PC 的架构里,内存与显存是两个相对独立的池子。模型权重必须放进显存才能被 GPU 高效计算,而独立显卡的显存容量通常有限。当模型规模超过显存上限时,常见做法是分层卸载或量化压缩,代价是速度下降或精度损失。
统一内存的做法是让 CPU、GPU 与 NPU 访问同一个内存池,数据不必在隔离的地址空间之间来回搬运。按公开说明,这套设计的意义主要体现在「能否装下模型」,而不只是单次推理速度。对需要同时加载多个模型的智能体应用来说,容量往往会先于算力成为限制因素。
但这里必须补一句限定:实际能跑多大规模,仍取决于量化精度、上下文长度、键值缓存占用与推理框架的优化程度。官方给出的 3000 亿参数更像一条规格上限,而不是日常可用的稳定配置。同一份材料也提示了这一点——真正跑起来要看具体模型。
三种计算单元的分工
旗舰型号锐龙 AI Max+ PRO 495 的构成是这样的:基于 Zen 5 架构,16 核 32 线程,最高加速频率 5.2GHz;集成 Radeon 8065S 显卡,包含 40 个 RDNA 3.5 图形计算单元;同时集成基于 XDNA 2 架构、算力最高 55 TOPS 的 NPU。可配置功耗范围为 45 至 120 瓦,因此合作伙伴可以在迷你主机、紧凑工作站与移动设备之间做不同取舍。
这套异构组合对应到智能体工作流,分工大致可以这样理解:GPU 承担大模型或多模态模型的批量推理;NPU 处理低功耗、需要持续运行的轻量任务;CPU 负责智能体编排、工具调用以及传统软件逻辑。
这个划分方式本身就是一份对智能体负载的判断。它承认智能体不是单一模型的持续推理,而是一串异构环节的接力:编排是控制逻辑,适合放在通用核心上;常驻的感知或分类任务功耗敏感,适合 NPU;真正吃算力的批量推理交给 GPU。需要提醒的是,要充分利用三类计算单元,还需要操作系统、推理框架与应用层完成相应的任务拆分与调度——这部分工作不在芯片侧。
生态侧的三个项目与落地案例
硬件之外,AMD 同步启动了三项面向开发者的计划:一项面向高校建立联合实验室,推动端侧 AI 教学与科研;一项针对行业软件供应商提供适配支持,降低企业应用迁移门槛;一项孵化开发者社区,并配套举办智能体应用创新大赛。
现场展示的行业案例覆盖了若干具体场景。科研方向有蛋白质设计智能体,以大语言模型为入口,编排若干专业模型在本地协同运行,让药企与高校实验室不必排队等云端算力。金融方向有端侧金融智能体,把投资检索、量化研究、组合归因、合规风控与文档处理封装成可调用的技能,由大模型负责理解任务与组织流程,确定性工具负责计算与校验。企业投标方向有智能标书助手,可以读取数百页招标文件、提取资质条件与评分标准、生成结构化初稿并做合规复核,资料全程不出企业内网。内容创作方向有影视智能体,从一句创意出发完成剧本解析、分镜与配音,敏感素材在本地处理、渲染按需调用云端。
这些案例有一个共同点:敏感数据留在本地,重负载按需外溢。这也解释了端侧智能体在企业侧的真实卖点——不是性能更强,而是合规成本更低。
竞品与市场背景
按公开信息,这一代产品近期预计将有超过 20 款基于旗舰平台的整机上市,形态覆盖迷你主机、紧凑型工作站、笔记本、平板、一体机与 AI 存储设备。参与首发的合作伙伴包括多家整机与主板厂商。
竞争层面,公开报道提到这一价位与形态段将迎来英伟达的对应产品,两者在端侧 AI 计算与统一内存架构上正面相遇。对开发者与采购方而言,竞争带来的直接结果是选择变多、价格与生态适配度成为关键变量。
中立思辨
需要辩证看待几件事。其一,3000 亿参数是一条规格上限,不是日常可用的稳定配置。同一台设备上同时跑多个模型、维持长上下文、挂载检索索引,实际可用的参数规模会明显低于上限。采购决策应以真实工作流实测为准,而不是以规格表为准。
其二,端侧的价值主张建立在「数据不出域」之上,而这一诉求的强度因行业而异。对数据敏感度高的行业,本地推理是刚性需求;对一般办公场景,云端方案的成熟度与成本仍占优。端侧并非普遍更优,而是特定约束下的更优解。
其三,异构调度是收益来源,也是复杂度来源。三类计算单元各有所长,但要让任务正确落到合适的单元上,需要应用层配合。现实中更常见的情况是开发者只用了其中一类,其余算力闲置——这会削弱硬件升级的实际收益。
其四,端侧承载的模型规模越大,本地治理的责任也越重。模型在本地运行意味着数据不外流,但也意味着模型行为、访问控制与审计记录都落在企业自己身上。硬件解决了「在哪里跑」,不解决「谁在管」。
其五,具体售价、各型号的完整规格差异、第三方独立评测的性能数据,公开材料未展开说明。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
给端侧选型团队的三条做法
把这次发布背后的判断拆出来,有三条可以直接用。
按工作流估算内存,而不是按模型估算。把一条完整智能体流程里需要同时驻留的模型、索引、缓存与上下文加总,再乘一个安全余量。这个数字通常比单看模型参数量得到的结论更接近现实。
先明确哪部分数据必须留在本地。端侧方案的收益来自合规与延迟,成本来自容量与运维。把数据按敏感度分层,只把必须本地处理的部分放到端侧,是更经济的组合方式。
把调度能力当成验收项。采购时除了看规格,还应要求供应商演示在真实工作流下三类计算单元的占用分布。如果 NPU 长期闲置、GPU 长期满载,说明任务拆分没有做起来,硬件的异构优势并未兑现。