
商汤最新开源了 SenseNova-U1.5,8B 参数,免费可商用。
一个模型打通文生图、图像编辑、图文交错生成、视觉理解全链路。开源模型里,综合 benchmark 分数追平了 GPT-Image-1、DALL-E 3 这类闭源巨头。

01 核心创新:不要 VAE,不要视觉编码器
传统多模态模型有个结构性问题:理解用视觉编码器(VE),生成用变分自编码器(VAE),两个子系统各干各的,信息在翻译过程中不断损耗。
SenseNova-U1 从第一性原理出发,提出了 NEO-unify 架构——彻底干掉 VE 和 VAE,语言 token 和视觉 token 在同一个模型里端到端建模。
这意味着什么?模型不再需要”先把图翻译成文字,再用文字生成图”,而是在一个统一的表示空间里,理解和生成是同一条路。
结果就是:理解能力强了,生成质量也提升了,而且省掉了一整个 VAE 的计算开销。
02 8B 吊打闭源模型
U1.5 正式版 8 月 20 号刚发,benchmark 数据已经出来了:
文生图质量:在 Qwen-Image-Bench 上从 47.14 提升到 55.20,超过多数开源生图模型。GenEval 0.91,领跑开源阵营(Qwen-Image 0.87,BAGEL 0.82)。DPG-Bench 全球分数 94.19,所有对比模型第一。
知识驱动生成:WISE 基准(评测模型能否把文化、物理、化学等知识转化为视觉输出)启用 CoT 后 0.81,追平 GPT-Image-1(0.80),超过多数闭源模型。
图文交错生成:openING 测试中 9.16,超越 Nano Banana(8.85)、Wan-Weaver(8.67)、GPT-4o + DALL-E 3(8.20)。
理解能力:MMLU-Pro 84.04,IFEval 92.39,IFBench 79.79——语言理解没有因为多模态而牺牲,IFBench 比 Qwen 3.5-9B 高出 15.29 分。
原生 4K 生成:U1.5 新增原生 4K 支持,全局结构连贯性、高分辨率输出稳定性显著提升,直接输出 4K 分辨率图像,不需要后期放大。
03 效果展示
文生图
人物生成质量稳定,手部结构、面部细节都处理得不错。

文字渲染是传统生图模型的痛点。SenseNova-U1 在中英文密集文字场景下表现突出,海报标题、信息图文字都清晰可读。

信息图生成
从需求描述直接生成完整信息图,文案排版、图标绘制、数据可视化一步到位。

图文交错生成
一个模型生成多页图文内容,角色一致、风格统一、叙事连贯。适合做绘本、教程、PPT。

CoT 推理可视化
U1 的一个独特能力:生成过程中可以看到模型的推理路径。从理解指令到建立画面,每一步都展示出来,透明可解释。
04 性能对比
在多项 benchmark 上,U1.5 同时赢了对标开源模型和闭源模型:

性能与速度方面,在 OneIG、LongText、BizGenEval、CVTG、IGenBench 等多个基准上,8B 模型在相同延迟下取得了领先于更多参数的竞品模型的效果。

05 怎么跑起来
快速验证(需要 GPU):
git clone https://github.com/OpenSenseNova/SenseNova-U1.git
cd SenseNova-U1
pip install -e .
# 文生图python examples/t2i/inference.py
--model_path sensenova/SenseNova-U1.5-8B-MoT
--prompt "A formal portrait of a man in 18th-century attire"
--output output.png
低显存部署(4GB+ 显存):
pip install "gguf>=0.10.0" "diffusers>=0.30.0"
python examples/t2i/inference.py
--model_path sensenova/SenseNova-U1.5-8B-MoT-Preview
--gguf_checkpoint /path/to/Q8.gguf
--prompt "A male peacock trying to attract a female"
--output output_gguf.png
生产环境:
使用 LightLLM + LightX2V,支持并发请求、负载均衡、API 服务化部署。
在线体验:
06 已知局限
商汤也没有掩饰 U1.5 还在解决的问题:
- • 密集小字号文字仍有错误,中英文混排偶尔翻车
- • 高约束版式(精确计数、对齐)偶尔偏差
- • 手部、小人脸等细粒度细节不稳定
- • 大范围多轮编辑可能偏移
- • 部分 prompt 高频细节过多或色彩过饱和,可降
cfg_scale缓解
写在最后
8B 参数,一个模型打通理解 + 生成 + 编辑 + 推理,性能追平 GPT-Image-1。
商汤这次把多模态的门槛直接砍到了地面。
免费开源,Apache 2.0 协议,个人商用都能用。





评论(0)