作者: · 发布:

免费开源!8B 吊打 GPT-Image,4K 直出

商汤最新开源了 SenseNova-U1.5,8B 参数,免费可商用。

一个模型打通文生图、图像编辑、图文交错生成、视觉理解全链路。开源模型里,综合 benchmark 分数追平了 GPT-Image-1、DALL-E 3 这类闭源巨头。

免费开源!8B 吊打 GPT-Image,4K 直出

01 核心创新:不要 VAE,不要视觉编码器

传统多模态模型有个结构性问题:理解用视觉编码器(VE),生成用变分自编码器(VAE),两个子系统各干各的,信息在翻译过程中不断损耗。

SenseNova-U1 从第一性原理出发,提出了 NEO-unify 架构——彻底干掉 VE 和 VAE,语言 token 和视觉 token 在同一个模型里端到端建模。

这意味着什么?模型不再需要”先把图翻译成文字,再用文字生成图”,而是在一个统一的表示空间里,理解和生成是同一条路。

结果就是:理解能力强了,生成质量也提升了,而且省掉了一整个 VAE 的计算开销。

02 8B 吊打闭源模型

U1.5 正式版 8 月 20 号刚发,benchmark 数据已经出来了:

文生图质量:在 Qwen-Image-Bench 上从 47.14 提升到 55.20,超过多数开源生图模型。GenEval 0.91,领跑开源阵营(Qwen-Image 0.87,BAGEL 0.82)。DPG-Bench 全球分数 94.19,所有对比模型第一。

知识驱动生成:WISE 基准(评测模型能否把文化、物理、化学等知识转化为视觉输出)启用 CoT 后 0.81,追平 GPT-Image-1(0.80),超过多数闭源模型。

图文交错生成:openING 测试中 9.16,超越 Nano Banana(8.85)、Wan-Weaver(8.67)、GPT-4o + DALL-E 3(8.20)。

理解能力:MMLU-Pro 84.04,IFEval 92.39,IFBench 79.79——语言理解没有因为多模态而牺牲,IFBench 比 Qwen 3.5-9B 高出 15.29 分。

原生 4K 生成:U1.5 新增原生 4K 支持,全局结构连贯性、高分辨率输出稳定性显著提升,直接输出 4K 分辨率图像,不需要后期放大。

03 效果展示

文生图

人物生成质量稳定,手部结构、面部细节都处理得不错。

免费开源!8B 吊打 GPT-Image,4K 直出

文字渲染是传统生图模型的痛点。SenseNova-U1 在中英文密集文字场景下表现突出,海报标题、信息图文字都清晰可读。

免费开源!8B 吊打 GPT-Image,4K 直出

信息图生成

从需求描述直接生成完整信息图,文案排版、图标绘制、数据可视化一步到位。

免费开源!8B 吊打 GPT-Image,4K 直出

图文交错生成

一个模型生成多页图文内容,角色一致、风格统一、叙事连贯。适合做绘本、教程、PPT。

免费开源!8B 吊打 GPT-Image,4K 直出

CoT 推理可视化

U1 的一个独特能力:生成过程中可以看到模型的推理路径。从理解指令到建立画面,每一步都展示出来,透明可解释。

04 性能对比

在多项 benchmark 上,U1.5 同时赢了对标开源模型和闭源模型:

免费开源!8B 吊打 GPT-Image,4K 直出

性能与速度方面,在 OneIG、LongText、BizGenEval、CVTG、IGenBench 等多个基准上,8B 模型在相同延迟下取得了领先于更多参数的竞品模型的效果。

免费开源!8B 吊打 GPT-Image,4K 直出

05 怎么跑起来

快速验证(需要 GPU):

git clone https://github.com/OpenSenseNova/SenseNova-U1.git
cd SenseNova-U1
pip install -e .
# 文生图python examples/t2i/inference.py 
  --model_path sensenova/SenseNova-U1.5-8B-MoT 
  --prompt "A formal portrait of a man in 18th-century attire" 
  --output output.png

低显存部署(4GB+ 显存):

pip install "gguf>=0.10.0" "diffusers>=0.30.0"
python examples/t2i/inference.py 
  --model_path sensenova/SenseNova-U1.5-8B-MoT-Preview 
  --gguf_checkpoint /path/to/Q8.gguf 
  --prompt "A male peacock trying to attract a female" 
  --output output_gguf.png

生产环境:

使用 LightLLM + LightX2V,支持并发请求、负载均衡、API 服务化部署。

在线体验:

https://unify.light-ai.top/

06 已知局限

商汤也没有掩饰 U1.5 还在解决的问题:

  • • 密集小字号文字仍有错误,中英文混排偶尔翻车
  • • 高约束版式(精确计数、对齐)偶尔偏差
  • • 手部、小人脸等细粒度细节不稳定
  • • 大范围多轮编辑可能偏移
  • • 部分 prompt 高频细节过多或色彩过饱和,可降 cfg_scale 缓解

写在最后

8B 参数,一个模型打通理解 + 生成 + 编辑 + 推理,性能追平 GPT-Image-1。

商汤这次把多模态的门槛直接砍到了地面。

免费开源,Apache 2.0 协议,个人商用都能用。

GitHub:https://github.com/OpenSenseNova/SenseNova-U1

颜资源站长
颜资源站长 已发布 825 篇文章

资深互联网从业者,专注AI工具研究与实战应用。长期跟踪ChatGPT、Claude、Stable Diffusion等前沿AI技术,擅长将复杂的技术概念转化为通俗易懂的教程。运营颜资源小站,致力于为中文用户提供高质量的AI教程、开源项目推荐和数字资源整理。