商汤开源SenseNova U1.5 Lite:8B参数实现4K直出,复杂指令与编辑能力比肩闭源模型

2026/08/25 14:53阅读量 5

商汤科技正式开源SenseNova U1.5 Lite,这是一款仅8B参数的统一多模态生图模型,支持原生4K高分辨率输出。该模型在超长指令遵循、复杂布局排版及精准局部图像编辑方面表现显著,实测效果可媲美GPT-Image-2等闭源竞品。其核心技术采用“先拆分专项训练、再融合蒸馏”的策略,实现了理解与生成的双向反哺,旨在提升AI视觉内容从生成到交付的稳定性与工作流适配度。

事件概述

商汤科技(SenseNova)正式开源了SenseNova U1.5 Lite模型。作为此前Preview版本的迭代升级,该版本主打“更完整、更准确、更稳定”,在保持8B轻量级参数量级的同时,显著提升了视觉生成质量、指令遵循能力及图像编辑精度,核心场景表现被评估为比肩闭源的GPT-Image-2。

核心性能亮点

  • 原生4K高分辨率输出:直接生成4K高清图,有效保留构图、纹理、小字及光影细节。
  • 超长复杂指令遵循:支持3-4k字符长度的Prompt,能同时处理主体、数量、位置、文字、布局和风格等多重约束,减少细节遗漏。
  • 高精度原生图像编辑:支持框选、标记和多图参考,修改指定区域时能精准保持人物、结构、版式及其他非编辑区域的完整性。
  • 复杂文字与布局优化:在中英文文字渲染、海报设计、信息图及多文本排版上准确率更高,擅长组织复杂画面结构。

技术架构与训练策略

SenseNova U1.5 Lite基于NEO-unify原生统一多模态架构,将视觉理解、图像生成和编辑整合在同一模型中,避免了传统路由机制带来的调用延迟和部署复杂性。

  • “先拆后合”的训练方法:在训练阶段,分别针对文字渲染、美学表达、图像编辑等目标训练专项Expert;随后通过多教师在线策略蒸馏技术(MOPD),将这些专项能力重新融合至统一的8B模型中。
  • 理解与生成双向反哺:视觉语义理解和空间建模形成的结构化认知,直接辅助后续的像素生成与编辑过程。
  • 后训练强化重点:专门强化了指令遵循(确保长指令执行无误)、视觉偏好(提升构图与质感)和编辑保持(确保非编辑区域不变)三项关键能力,并引入提示词增强(PE)以优化简短需求的意图解析。

实际应用场景验证

  • 复杂信息图生成:能够在一页内有序组织长文本、多层级结构、插画及数字顺序,如制作从可可豆到巧克力的六阶段生产流程信息图。
  • 社交媒体封面设计:在保持统一时尚调性的前提下,精准控制多个主体(如不同造型的人物或动物)的布局与表情,避免元素冲突。
  • 多图参考编辑:支持将一张图的版式风格、另一张图的人物内容、第三张图的文字层级进行分离理解与重组。例如,将乐队成员形象融入做旧海报风格,并重构右侧文字列表,同时去除原背景色块。
  • 精准局部改字:能在保持原有字体样式、排版布局及周围图形不变的情况下,精确替换指定区域内的文本内容。

行业意义

SenseNova U1.5 Lite的发布标志着生图模型的评价标准从单纯的“视觉惊艳度”转向“工作流稳定性”。通过统一模型架构替代多模型拼接,该方案缩短了调用链路,降低了部署成本,旨在解决AI视觉内容从生成、修改到最终交付的全链路痛点,为开发者和创作者提供“快、好、省”的生产力工具。

资源链接:

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。