多模态 AI 正在告别「单点式内容生成」。7月18日 WAIC 上,商汤科技发布旗舰新品 SenseNova U1 Pro,定位为「面向长程任务的交付级原生多模态智能体基座」,强调理解、生成与行动的深度统一。它把多模态的演进划分到第三阶段:从解决「生成美」的单点创作,到可交互的可控生成,再到如今正式迈向「系统级交付」。
一、四大核心交付能力:从「能生成」到「能交付」
围绕「一个复杂目标,持续理解、规划、执行、检查和修正」,U1 Pro 给出四项能力。其一是巅峰设计美感:图像生成从「细节逼真」推进到专业构图、色彩与排版美学,直接达到专业交付品质;其二是原生 8K 超清输出:最高支持 8K 原生分辨率,高信息密度的超长、超大图在放大后文字、线条、图标仍清晰稳定,经得起印刷与展览级检验;其三是极致的图文与细节控制:在极高信息密度下维持整体版式,文字渲染出错率极低;其四是长程 Agentic 闭环:支持数十轮 Agentic Generation Loop(智能体生成循环),并对整体风格与局部文本实现同步精准可控编辑,让交付结果可被持续修改与复用。
二、底座 NEO-unify:打破理解与生成的割裂
商汤把「能稳定交付」的底层归功于一贯的原生统一架构。NEO-unify 内核在原生多模态体系中实现语言与视觉的统一表征,打破了「理解」与「生成」长期割裂的壁垒;其开源的 SenseNova-Vision 统一视觉大模型,更让实例分割、目标检测等经典视觉任务直接成为通用大模型的原生能力,告别传统「多专家模型拼凑」的局限。十余年视觉 AI 沉淀,为多模态长程智能体提供了稳定底座。
三、落地与开放路径
据披露,U1 Pro 的能力已在商汤产业级 AI「小浣熊」与视频创作工具「Seko」中深度验证;预览版已开启邀请测试,正式版将于今年 8 月上线并同步推出 API 与定价。开放生态侧,截至 7 月中旬 SenseNova U1 及集成其能力的 SenseNova-Skills 代码库在 GitHub 总 Star 数突破 8000,U1 用户人均日生图量在 6 月较 5 月提升近 3 倍,说明模型已切入真实工作流。
四、客观看:交付级是升级,成本与稳定仍是门槛
「交付级」相对「抽卡式生成」是明确的范式升级,但客观评估,8K 与长程闭环背后的算力成本、商业可用性仍需检验。CEO 徐立强调「好的 AI 产品既扩展人的能力,更促进人的成长」——是能力拓展而非替代,并引用相关预测称到 2030 年 AI 可能减少 9200 万个岗位、同时创造 1.7 亿个新岗位。多模态进入「能交付」阶段令人振奋,但工程的稳定与成本,才是决定它能否真正走进办公、电商、教育每一个生产单元的关键。