商汤科技宣布面向社区开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lite-Preview。
公告称,SenseNova U1.5-Lite-Preview并非简单的模型规模升级,而是基于 SenseNova U1 的一次系统性迭代,不仅在同一架构中贯通视觉理解、推理、生成与编辑,还仅以 8B-MoT 的轻量大小,将能力推进到4K、更精细的真实质感、更复杂的视觉控制和可持续迭代编辑。

相比 U1,U1.5-Lite-Preview 在以下方向上带来了显著提升:
- 原生支持4K图像生成;
- 更精细的局部纹理、细节与真实世界质感;
- 更准确的中英文文字生成与复杂版式组织;
- 更稳定的图像编辑和视觉指令遵循。
“如果说 U1 成功验证了统一架构是否可行,证明了从像素和语言出发、端到端构建原生统一多模态模型是一条可行的路线,那么 U1.5 将进一步验证能力能否持续扩展,证明统一架构不仅能够同时承载理解和生成,也能够继续扩展到更高分辨率、更复杂的信息表达和更真实的视觉世界。”
U1.5-Lite-Preview 在不盲目扩大模型规模的前提下,对生成与编辑全链路进行系统性优化:
- 针对网格伪影和高分辨率细节建模问题,U1.5-Lite-Preview重新设计了生成头,减弱视觉Token网格对最终图像的影响,并将训练进一步扩展至4K分辨率。
- 针对图像编辑,U1.5-Lite-Preview重新组织了编辑数据与训练任务,强化模型对原图内容、主体身份、空间结构和非编辑区域的保持能力,使其能够在完成目标修改的同时,尽可能保留原图中不需要改变的部分。
U1.5-Lite-Preview 的一些测评结果如下:
- Qwen-Image-Bench从47.14提升到了55.20(with Prompt Enhance)
- ImgEdit-Bench从3.90提升到4.37
- GEdit-Bench-en从7.47提升到8.17
- GEdit-Bench-zh从7.42提升到8.05

