商湯於8月20日在GitHub為SenseNova-U1.5-8B-MoT掛上正式版標籤,授權條款為Apache 2.0,權重同步上架Hugging Face與魔搭(ModelScope)。距離7月31日釋出的Preview版僅三週,距離這條產品線首次開源(今年4月27日的U1-8B-MoT)則不到四個月。
這次的新版本主打兩件事:原生4K出圖,以及把圖像編輯與精確控制整合進同一個模型。
一個模型,三種參數口徑
先講一個容易讓人看花眼的地方。模型名稱裡寫著8B;倉庫README補了一句註解,說明8B-MoT指的是大約80億理解參數加上大約80億生成參數;而Hugging Face模型卡上列出的張量規模則是180億,精度為F32與BF16。
三個數字都沒有錯,只是在算不同的東西。MoT是Mixture of Transformers的縮寫,商湯這套架構讓理解與生成各自走一座塔,在同一條序列上交替運作。理解塔與生成塔究竟該合併計數、只報告啟用規模,還是乾脆分開列,目前業界並沒有共同慣例,各家統一多模態模型的發布頁面各寫各的版本。
對開發者來說,實際的影響是:用參數量橫向比較這幾個模型,參考價值正在下降。真要比較,得看單張顯卡裝不裝得下、出一張4K圖要花多久、顯存峰值多高。這幾項數據,商湯這次並沒有在發布頁給出統一口徑。
4K直接生成,而非事後放大
原生4K這個說法需要拆解一下。目前要把圖做到4K,常見有兩條路徑:一條是模型先出一張解析度較低的圖,再交給放大模型重新生成細節;另一條則是讓生成模型直接在目標解析度上工作。
兩條路徑的差別不在最終的像素數,而在結構一致性。走放大路線時,整體構圖在低解析度階段就已經定案,放大環節只能補細節,一旦遇到密集文字、複雜版面、多主體關係,就容易在放大過程中產生錯位。商湯這次把4K直接放進生成本身,官方說法是「整體構圖與極精細紋理、微觀細節兼得」,並強調這一版的4K生成效率有所提升。
發布頁列出六項使用者可見的改進,除了4K之外,其餘五項都圍繞著可控性:出圖的構圖、材質、光影更接近實拍效果;原生圖像編輯能更好地保住主體身份與空間結構;中英文文字渲染,以及資訊圖表、海報這類複雜版面的可讀性有所提升;對物體數量、空間關係這類複雜指令的跟隨更穩定;可以用偵測框、視覺標記與多圖參考來做精確控制。
最後這一項,對開發設計工具的團隊來說比較實用。用框線和標記指定「改這裡」,比反覆調整提示詞描述位置更省事,也更容易接進既有的編輯器介面。
把已知缺陷寫進發布頁
模型卡後半段有一節,列出五項尚未解決的問題:細節容易過度強化、密集文字仍會出錯、在受限版面下表現不穩、人物細節不穩定、複雜編輯會出現漂移。
在中國大陸開源模型的發布資料裡,主動列出這一節的並不多見。它的作用不只是顯得誠實。這五項問題基本上就是這類模型目前共通的難題,寫出來等於替下游省下一輪試錯,也替後續版本留下可對照的基準線。
同期還釋出一個SenseNova-U1.5-8B-MoT-LoRA-8step,是0.4B規模的8步蒸餾版,鎖定的是延遲敏感的應用場景。再加上Apache 2.0這個授權條款——允許商用、不帶傳染性條款——以及GitHub、Hugging Face、魔搭三處託管,這次發布把能降低的接入門檻基本上都降完了。
剩下的問題回到老地方:開源權重解決的是「拿不拿得到」,解決不了「跑不跑得動」。8B加8B的雙塔結構直出4K,顯存占用不會低,決定它會被多少團隊用起來的,終究還是那張單卡夠不夠力。
參考來源:CocoLoop、GitHub 倉庫 OpenSenseNova/SenseNova-U1、Hugging Face 模型卡、IT之家;版本標籤、授權條款、參數口徑與六項改進均按倉庫說明與模型卡逐條核對。