铭鸿体育资讯网

海外热议的“8B小钢炮”这个模型有点东西

今天聊聊,海外技术圈最近都在热议的一个开源生图模型,商汤SenseNova U1.5 Lite,人称“8B小钢炮”。

X上、Reddit上、GitHub上不少开发者都在说,它的参数只有8B,但在指令遵循和编辑保持度上比同量级模型做得更好,文字渲染和复杂布局甚至能跟超大规模商业模型掰手腕。

我觉得商汤这个方向挺清晰的。别家都在卷参数,今天几千亿,明天万亿,听起来都很热闹,而商汤在认真解决一个很现实的问题:生图模型到底能不能进生产流程?

说实话,现在会生图的模型已经不少了。随便写一句prompt,出一张氛围感图片,并不稀奇。
真正麻烦的是后面的部分。

比如要做一张品牌海报,里面有中文标题、英文副标题、产品图、人物、背景、版式关系,还要符合指定风格。

再比如改图。你只是想换掉画面里的一个元素,模型却顺手把人物脸、背景结构、文字位置也一起改了。看起来很“聪明”,但对真实工作来说,这就是返工。

商汤这次的SenseNova U1.5 Lite,重点就在这些地方下功夫。复杂指令遵循、文字和复杂布局、Native 4K、原生图像编辑、精细视觉控制,听着不如万亿参数刺激,但都是创作团队每天会遇到的问题。

我比较关注的是它的统一模型路线。

它没有把OCR、美学、编辑拆成一堆模型让用户自己选,而是先做专项强化,再把这些能力重新蒸馏回一个U1.5 Lite里。使用时不用在多个模型之间切来切去。

官方提到一个细节挺有意思:理解能力开始反哺生成。

一般多模态模型,理解和生成是两套系统。但U1.5 Lite在统一训练体系里,视觉理解学到的空间关系、结构认知,能直接迁移到生成和编辑任务上。

从评测看,U1.5 Lite相比之前的版本U1和Preview也有明显提升。Qwen-Image-Bench到了60.17,ImgEdit到4.59。至少说明它不是只在demo里好看。

开源生图走到现在,真正的门槛已经不只是生成,而是能不能少返工、稳定改、被团队放心用”。

这条路听起来不如卷参数热闹,但有人愿意在这个方向死磕,还挺难得的。