SenseNova U1.5-Lite-Preview 开源,原生统一多模态升级至 4K 生成与可迭代编辑
2026/08/03 19:27阅读量 2
商汤科技开源 SenseNova U1.5-Lite-Preview,该模型基于 NEO-Unify 架构,以 8B-MoT 规模在单一模型中贯通视觉理解、推理、生成与编辑。相较 U1,新版本新增原生 4K 图像生成,并优化中英文文字生成、复杂版式组织、图像编辑和视觉指令跟随能力。模型已上线 GitHub、Hugging Face 和魔搭社区,面向专业用户的 U1 Pro 尚处于邀请测试阶段。
事件概述
商汤科技开源 SenseNova U1.5-Lite-Preview。该模型基于此前 U1 使用的 NEO-Unify 架构,延续原生统一多模态路线:在同一模型中联合建模语言、视觉语义和像素生成,让视觉理解、推理、生成与编辑由单一模型完成。此次开源版本规模为 8B-MoT,并非简单扩大参数,而是在 U1 基础上进行了系统性迭代。
核心能力升级
- 原生 4K 生成:支持 4K 分辨率图像生成,并针对高分辨率下的细节、材质、光影与整体一致性做了强化。
- 图像质感提升:改善局部纹理、细节和真实世界质感,减少网格感、拼接痕迹和纹理断裂。
- 中英文文字与版式:提升中英文文字生成准确度和复杂版式组织能力,适用于杂志内页、旅行攻略、信息图等场景。
- 图像编辑能力:在同一个模型中完成视觉理解、目标定位、约束推理和像素生成,支持局部修改、参考图风格迁移、多图要素融合、文字编辑和区域标记编辑,强调可持续迭代编辑。
- 视觉指令跟随:优化对长文本和结构化创作指令的理解。官方称即使不依赖专门的 Prompt Enhance 格式化数据训练,模型也能稳定执行多约束视觉指令;同时提供实验性 Prompt Enhance Skill,将简短想法扩展为完整创作方案。
针对 U1 痛点的改进
U1.5-Lite-Preview 针对 U1 在生成和编辑中的已知问题做了优化:
- 重新设计生成头,减弱视觉 Token 网格对最终图像的影响,并将训练扩展到 4K;
- 重新组织编辑数据与训练任务,强化对原图内容、主体身份、空间结构和非编辑区域的保持,减少编辑范围外内容变化、主体漂移等问题;
- 采用 encoder-free 视觉建模方式,避免固定视觉编码器带来的信息压缩和表征瓶颈,保留文字笔画、局部纹理、空间结构等精细信息。
评测表现
据官方数据,U1.5-Lite-Preview 在多项基准上超过 U1:
| 基准 | U1 | U1.5-Lite-Preview |
|---|---|---|
| Qwen-Image-Bench | 47.14 | 55.20(with Prompt Enhance) |
| ImgEdit-Bench | 3.90 | 4.37 |
| GEdit-Bench-en | 7.47 | 8.17 |
| GEdit-Bench-zh | 7.42 | 8.05 |
开源与获取
模型面向全球开源,可通过以下渠道获取:
- GitHub: https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md
- Hugging Face: https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
- 魔搭社区: https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview
面向专业用户的交付级创作模型 U1 Pro 目前处于邀请测试阶段,预计近期对公众开放服务。
