← 返回首页
🖼️

SenseNova-U1.5

商汤科技(SenseTime)

8B-MoT 原生统一多模态模型,一套架构看懂图/生图/改图,原生 4K 生成

多模态 开源 模型
B+
小而全的开源统一多模态模型
⭐⭐⭐⭐

📖 产品简介

商汤 SenseNova 团队于 2026 年 9 月 10 日发布 SenseNova-U1.5 技术报告(arXiv:2609.11929)。

这是一款 8.2B 参数的 MoT(Mixture-of-Transformers)原生统一多模态模型,采用 NEO-unify 架构,取消独立视觉编码器与 VAE,让文字与图像补丁进入统一序列,在单一模型内完成理解、生成与编辑。预训练覆盖 256–1024 像素(18 万步),再扩展至 512–4096 像素(10 万步,序列长度提至 20480),实现原生 4K 生成;后训练分别优化美学、双语文字渲染、信息图、图像编辑等专家,并以多专家在策略蒸馏合并回单一模型。基准:GenEval 0.92、CVTG-2K 文字渲染 0.948、ImgEdit 4.59;VBVR-Pro-Bench 域内 67.6%、域外 48.7%,官方称在交错生成上超越部分专有系统。权重已于 8 月 20 日上架 HuggingFace(Apache 2.0),并将开源监督微调/强化学习/在策略蒸馏训练代码。

定位
8B-MoT 原生统一多模态模型,一套架构看懂图/生图/改图,原生 4K 生成
适合人群
多模态研究与开发者 海报/商品图/信息图创作 需要自部署可控的图像模型团队 关注开源统一架构的厂商
支持平台
HuggingFace、自部署
开源

核心功能

  • 🧩 原生统一:无编码器/无 VAE,理解+生成+编辑同一套架构
  • 🖼️ 原生 4K 生成:序列长度扩至 20480,直接处理大画布
  • 🔤 双语文字渲染:CVTG-2K 0.948,海报/信息图文字稳定
  • ✂️ 图像编辑与多参考:局部替换、身份保持、多图参考组合
  • 📊 基准领先:GenEval 0.92、ImgEdit 4.59
  • 🔓 Apache 2.0 开源,权重已发布,将开源训练代码

⚖️ 优缺点分析

👍 优点

  • 小参数(8B)实现理解/生成/编辑统一,端到端优雅
  • 原生 4K 生成,适合海报/商品/信息图等高分辨率创作
  • Apache 2.0 开源、权重已发布,可自部署可审计
  • 中英双语文字渲染质量高
  • 将开源训练代码,复现门槛低

👎 缺点

  • 高分辨率下复杂布局/细小文字/人物细节仍可能出错
  • VBVR-Pro-Bench 对比为厂商自报,需独立复核
  • 未公开 4K 下推理成本与延迟
  • 作为新架构,生态工具仍在积累

📊 评分详情

功能完整
8.5
易用程度
8
安全可靠
7.5
性价比
9

💬 用户评价

SenseNova-U1.5 把看图、生图、改图塞进一套 8B 架构还直出 4K,小模型统一多模态这条路被商汤走实了。

📝 更新日志

  • 2026-09-10
    技术报告发布
    商汤发布 SenseNova-U1.5 技术报告(arXiv:2609.11929):8.2B MoT 原生统一多模态模型,NEO-unify 架构取消视觉编码器与 VAE,统一理解/生成/编辑,原生 4K 生成;GenEval 0.92、CVTG-2K 0.948、ImgEdit 4.59。权重 8/20 已上架 HuggingFace(Apache 2.0),将开源训练代码。