商汤 8 月 20 日在 GitHub 上给 SenseNova-U1.5-8B-MoT 打了正式版标签,许可证 Apache 2.0,权重同步上了 Hugging Face 和魔搭。距离 7 月 31 日那版 Preview 三周,距离这条产品线第一次开源(今年 4 月 27 日的 U1-8B-MoT)不到四个月。
新版本主打两件事:原生 4K 出图,以及把图像编辑和精确控制做进同一个模型。
一个模型,三个参数口径
先说个容易看花眼的地方。模型名字里写着 8B;仓库 README 补了一句注解,8B-MoT 指的是大约 80 亿理解参数加大约 80 亿生成参数;而 Hugging Face 模型卡上列出的张量规模是 180 亿,精度 F32 与 BF16。
三个数字都对,只是在数不同的东西。MoT 是 Mixture of Transformers 的缩写,商汤这套架构让理解和生成各走各的一塔,在同一条序列上交替工作。理解塔和生成塔到底该合并计数、只报激活规模,还是干脆分开写,目前没有行业惯例,各家统一多模态模型的发布页各写各的。
对开发者的实际影响是:拿参数量横向比这几个模型,参考价值正在下降。真要比,得看单卡能不能装下、出一张 4K 图要多久、显存峰值多少。这几项商汤这次没在发布页给出统一口径。
4K 直接生成,而非事后放大
原生 4K 这个说法需要拆一下。目前把图做到 4K 有两条常见路径:一条是模型先出一张较低分辨率的图,再交给放大模型重生成细节;另一条是让生成模型直接在目标分辨率上工作。
两条路径的差别不在最终像素数,而在结构一致性。走放大路线时,全局构图在低分辨率阶段就定死了,放大环节只能补细节,遇到密集文字、复杂版式、多主体关系,容易在放大时产生错位。商汤这次把 4K 放进生成本身,官方措辞是”整体构图与极精细纹理、微观细节兼得”,并强调这一版的 4K 生成效率有提升。
发布页列的六项用户可见改进,除了 4K,其余五项都围着可控性转:出图的构图、材质、光影更接近实拍;原生图像编辑能更好地保住主体身份和空间结构;中英文本渲染与信息图、海报这类复杂版式的可读性提升;对物体数量、空间关系这类复杂指令的跟随更稳;可以用检测框、视觉标记和多图参考做精确控制。
最后这一项对做设计工具的团队比较实用。用框和标记指定”改这里”,比反复调提示词描述位置更省事,也更容易接进已有的编辑器界面。
把已知缺陷写进发布页
模型卡后半段有一节列了五条还没解决的问题:细节容易过度强化、密集文字仍会出错、受限版式下表现不稳、人物细节不稳定、复杂编辑会出现漂移。
在国产开源模型的发布材料里,主动摆出这一节的不多。它的作用不只是显得诚实。这五条基本就是这类模型当前的公共难题,写出来等于给下游省了一轮试错,也给后续版本留了可对照的基线。
同期还放出一个 SenseNova-U1.5-8B-MoT-LoRA-8step,0.4B 规模的 8 步蒸馏版,指向的是延迟敏感的场景。加上 Apache 2.0 这个许可证——允许商用、不带传染性条款——以及 GitHub、Hugging Face、魔搭三处托管,这次发布把能降的接入门槛基本降完了。
剩下的问题回到老地方:开源权重解决的是”能不能拿到”,解决不了”跑得起跑不起”。8B 加 8B 的双塔结构直出 4K,显存占用不会低,决定它被多少团队用起来的,仍然是那张单卡够不够。
参考来源:CocoLoop、GitHub 仓库 OpenSenseNova/SenseNova-U1、Hugging Face 模型卡、IT 之家;版本标签、许可证、参数口径与六项改进按仓库说明与模型卡逐条核对。