8 月 11 日,商汤科技旗下「日日新」上线全新多模态智能体模型 SenseNova 6.8 Flash Lite Preview 预览版,并正式登陆 SenseNova Token Plan 开放体验。商汤将这一方向定义为「委派智能」(Delegated Intelligence):用户主要负责提出目标,由 AI 自主规划并执行任务流程,最终由用户进行结果验收——探索从回答问题向端到端任务交付演进。围绕长程复杂任务,该预览版重点强化了长程稳定性、Sub-agent 动态协作与原生多模态融合三方面能力。

一、「委派智能」:从问答到交付的范式切换

「委派智能」的提出,本质上是把人机协作的接口从「提问—回答」切换为「给目标—收结果」。按照商汤的定位,用户不再需要描述每一步怎么做,而是说明要达成什么,模型负责把目标拆解为可执行的任务流程并自主推进。支撑这一范式的,是模型的三项能力升级:其一,长程稳定性——在数百步、跨阶段、持续数小时的任务过程中保持目标、约束与关键事实,并在任务执行失败时自主回退、重新规划;其二,Sub-agent 动态协作——主 Agent 可根据任务需要动态调度十余个专业 Agent,并行执行信息检索、数据分析、数学计算、视觉理解与事实核验等不同任务;其三,原生多模态融合——文字、图片、图表、文档、视频以及应用界面等信息,可在同一条任务轨迹下进行融合规划、推理、工具调用与结果验证。

二、能力画像:研究报告、PPT 与浏览器操作

商汤展示的案例勾勒出该模型的能力边界:面对市场动态、体育赛事和事件演化等分析任务时,模型可自主查阅新闻、政策和市场数据,通过多个 Agent 进行浏览器操作和信息搜集,再调用代码进行数据验证、绘制图表、编写文档,最终形成分析报告。除研究分析类任务外,新模型还可用于 PPT 制作、内容撰写、图表制作和版式设计,支持原生 HTML 动态演示,并能理解网页多模态信息、应用界面及本地文件,通过操作浏览器和应用执行部分办公、脚本编写及自动化任务。可以看出,这条路线与近期多家厂商的「任务交付」叙事一致——7 月以来,阿里 Qoder Voice 的实时语音协作、OpenAI 的 ChatGPT Work、腾讯 WorkBuddy 的跨端任务执行,都在把竞争焦点从模型「会不会答」转向「能不能干成」。商汤的差异化在于以「多模态融合」贯穿全程:规划、执行、验证都在同一多模态轨迹内完成,而非文本规划叠加工具调用。

三、定价与节奏:轻量版先行,正式版接力

在开放策略上,SenseNova 6.8 Flash Lite Preview 已开放体验,用户目前可享受每 5 小时 1500 次免费使用;正式版 SenseNova 6.8 Flash Lite 以及性能进一步提升的 SenseNova 6.8 Flash 将在近期发布,更多评测数据及完整功能计划于 8 月公布。从命名与节奏看,商汤采取的是「轻量预览版先行探路、正式版与高配版接力」的策略:先以低价甚至免费的入口吸引开发者与企业试用,再根据反馈调整正式版定位——这也符合当前多模态智能体模型「先占场景、再谈收费」的行业惯例。值得注意的是,商汤在此前已发布交付级原生多模态智能体基座 SenseNova U1 Pro(7 月 18 日 WAIC 期间),本次 6.8 Flash Lite 预览版与 U1 Pro 形成「基座+轻量入口」的组合:U1 Pro 面向交付级应用,Flash Lite 面向高频轻量任务,两条产品线互补覆盖不同档位的需求。

四、客观看:亮点与待验证之处

几点客观边界需要标注。其一,预览版的核心数据(长程任务成功率、Sub-agent 协作效率的具体评测)尚未公布,目前能力描述主要来自官方演示案例,实际效果需待正式版评测数据验证;其二,「委派智能」下的长程自主执行意味着模型将直接操作系统与浏览器,权限边界、误操作兜底与审计机制如何设计,商汤暂未披露——这也是所有「任务交付型」智能体共同面对的安全课题;其三,每 5 小时 1500 次的免费额度属于体验性质,正式版的定价与计费模型行业暂未披露;其四,多模态智能体赛道竞争激烈,商汤需在模型能力与商业化节奏之间找到平衡——同类产品的免费额度、企业落地案例与生态成熟度,都会影响开发者选择。总体而言,SenseNova 6.8 Flash Lite Preview 是「委派智能」叙事下的一次明确落子:以轻量多模态 + 多 Agent 协作为切口,把商汤在视觉与多模态上的积累转化为可交付的任务能力——而它能否真正兑现「用户给目标、AI 交结果」,还要看正式版的真实表现。