📖 产品简介
商汤 SenseNova 团队于 2026 年 9 月 10 日发布 SenseNova-U1.5 技术报告(arXiv:2609.11929)。
这是一款 8.2B 参数的 MoT(Mixture-of-Transformers)原生统一多模态模型,采用 NEO-unify 架构,取消独立视觉编码器与 VAE,让文字与图像补丁进入统一序列,在单一模型内完成理解、生成与编辑。预训练覆盖 256–1024 像素(18 万步),再扩展至 512–4096 像素(10 万步,序列长度提至 20480),实现原生 4K 生成;后训练分别优化美学、双语文字渲染、信息图、图像编辑等专家,并以多专家在策略蒸馏合并回单一模型。基准:GenEval 0.92、CVTG-2K 文字渲染 0.948、ImgEdit 4.59;VBVR-Pro-Bench 域内 67.6%、域外 48.7%,官方称在交错生成上超越部分专有系统。权重已于 8 月 20 日上架 HuggingFace(Apache 2.0),并将开源监督微调/强化学习/在策略蒸馏训练代码。
定位
8B-MoT 原生统一多模态模型,一套架构看懂图/生图/改图,原生 4K 生成
适合人群
多模态研究与开发者
海报/商品图/信息图创作
需要自部署可控的图像模型团队
关注开源统一架构的厂商
支持平台
HuggingFace、自部署
开源
是
✨ 核心功能
- 原生统一:无编码器/无 VAE,理解+生成+编辑同一套架构
- 原生 4K 生成:序列长度扩至 20480,直接处理大画布
- 双语文字渲染:CVTG-2K 0.948,海报/信息图文字稳定
- 图像编辑与多参考:局部替换、身份保持、多图参考组合
- 基准领先:GenEval 0.92、ImgEdit 4.59
- Apache 2.0 开源,权重已发布,将开源训练代码
⚖️ 优缺点分析
👍 优点
- 小参数(8B)实现理解/生成/编辑统一,端到端优雅
- 原生 4K 生成,适合海报/商品/信息图等高分辨率创作
- Apache 2.0 开源、权重已发布,可自部署可审计
- 中英双语文字渲染质量高
- 将开源训练代码,复现门槛低
👎 缺点
- 高分辨率下复杂布局/细小文字/人物细节仍可能出错
- VBVR-Pro-Bench 对比为厂商自报,需独立复核
- 未公开 4K 下推理成本与延迟
- 作为新架构,生态工具仍在积累
📊 评分详情
功能完整
8.5
易用程度
8
安全可靠
7.5
性价比
9
💬 用户评价
SenseNova-U1.5 把看图、生图、改图塞进一套 8B 架构还直出 4K,小模型统一多模态这条路被商汤走实了。
📝 更新日志
-
2026-09-10技术报告发布商汤发布 SenseNova-U1.5 技术报告(arXiv:2609.11929):8.2B MoT 原生统一多模态模型,NEO-unify 架构取消视觉编码器与 VAE,统一理解/生成/编辑,原生 4K 生成;GenEval 0.92、CVTG-2K 0.948、ImgEdit 4.59。权重 8/20 已上架 HuggingFace(Apache 2.0),将开源训练代码。