商汤开源轻量级生图模型SenseNova U1.5-Lite-Preview:4K直出,支持精准编辑

2026/08/03 19:59阅读量 4

商汤面向社区开源轻量级原生统一多模态模型SenseNova U1.5-Lite-Preview,仅8B-MoT参数即可4K直出图像,并支持复杂信息图生成、多图参考、局部文字修改和红框坐标定位编辑。官方公布的多个评测基准显示,该模型相较上一代有明显提升,正式版预计很快开源。

事件概述

商汤向开源社区发布轻量级原生统一多模态模型 SenseNova U1.5-Lite-Preview。该模型基于 NEO-Unify 架构,将语言、视觉语义与像素生成统一在同一模型内,覆盖视觉理解、推理、生成与编辑,参数规模为 8B-MoT,可原生直出 4K 图像。

核心能力

  • 支持长篇、多约束、层次化及结构化视觉指令,适合海报、信息图、品牌视觉等高信息密度内容。
  • 生成后支持参考图、多图组合、局部文字编辑,以及红框、坐标和 marker 定位编辑。
  • 在案例中,模型可保留原版式与设计框架,将影视主题信息图改版为邮政主题;能够把真实食物照片重新绘制为手绘食谱,也能将人物照片直接转为单栏简历。
  • 在将“迎”字改为“命”字的案例中,模型不是简单贴上一层新字,而是利用原图船体作为最后一竖、浪花重组其余笔画,让新字与画面自然融合。

技术路线与评测

  • 为支撑 4K 输出,官方重新设计了生成头,减弱视觉 Token 网格对画面的影响,并将训练扩展到 4K 分辨率,以减少放大后的网格感、拼接痕迹与纹理断裂。
  • 长 prompt 控制由 Prompt Enhance 增强,用户可逐层写明布局、风格、文字、比例和禁止项。
  • 评测方面,相较上一代 U1,U1.5-Lite-Preview 在 Qwen-Image-Bench(with Prompt Enhance)上从 47.14 提升至 55.20;ImgEdit-Bench 从 3.90 提升至 4.37;GEdit-Bench 英文项从 7.47 提升至 8.17,中文项从 7.42 提升至 8.05;在 WeEdit 榜单上的 Overall Average 为 6.44。

开源与后续

官方表示,U1.5 正式版很快就会开源;当前轻量预览版已面向开发者与创作者开放。开源渠道包括:

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。