新模型 2026-09-11

商汤开源 SenseNova-U1.5:8B 原生统一多模态模型,一套架构同时“看懂”和“画出”图像

商汤开源 SenseNova-U1.5:8B 原生统一多模态模型,一套架构同时“看懂”和“画出”图像

发生了什么

9 月 10 日(9 月 11 日集中报道),商汤发布 SenseNova-U1.5,一个 80 亿参数(8B)的“原生统一多模态模型”,权重已在 Hugging Face 放出(Apache 2.0,可商用)。

它的特别之处在于:大多数既能“看”图又能“画”图的模型,是在语言模型外面硬接一个图像生成器;而 SenseNova-U1.5 去掉了独立的视觉编码器和 VAE,用一套架构同时完成“理解图、推理、生成图”三件事,原生支持最高 4K 分辨率。论文(arXiv)同步公开,登上 Hugging Face 趋势论文榜;商汤表示还会开源训练代码(含监督微调、强化学习、在线蒸馏)。

对我有什么用

“统一架构”意味着理解和生成共享同一套知识,理论上画出来的图更懂你的指令、改图时更能保住主体 identity 和没改到的区域。基准上它拿到开源 SOTA:GenEval 0.92、文本绘制 CVTG-2K 0.948、ImgEdit 4.59;视觉推理 VBVR-Pro-Bench 68.2%,高于闭源的 Nano-Banana-Pro(56.4%)。对国产开源多模态阵营,这是一次“小参数也能打”的示范——8B 规格让更多人和小团队能玩得起。

我可以怎么做

  • 画图 / 改图:在 Hugging Face(sensenova/SenseNova-U1.5-8B-MoT)或后续接入的国产平台试用,适合做海报、带文字的图(招牌/信息图)、按参考图改图。
  • 中英文字渲染:它对“图里写中文/英文”做得不错,做带标语的图比很多模型稳,适合做封面、PPT 配图。
  • 开发者 / 研究者:Apache 2.0 权重 + 将开源的训练代码,可以拿来做二次开发、微调自己的行业模型。

温馨提醒

  • 当前权重已放、训练代码将开源,实际落地以商汤后续仓库更新为准;先把 demo/权重跑通再用于生产。
  • 8B 模型本地部署有显存门槛(4K 生成更需要资源),普通笔记本直接用云端或量化版本更现实。
  • 独立第三方复现仍少,宣传的“超过闭源”主要看基准分数,真实出图质感建议你亲自试几张再下结论。
📤 一键转发小助手 帮你写好小红书文案、微信群推荐语,还配一张中文海报,复制就能发