蚂蚁开源两款6B设计模型,能拆9个图层

蚂蚁集团百灵大模型团队 9 月 23 日开源 Ming-Image-0.1-Design 系列,一共两个模型,参数量都是 60 亿(6B),代码和权重放在 Hugging Face 的 inclusionAI 组织下,采用 MIT 协议。

  • Ming-Image-0.1-Design 负责”从文字到设计稿”:输入需求描述,生成 UI 界面、数据看板、信息图、海报这类以排版和文字为主的完整设计;
  • Ming-Image-0.1-Design-Layer 负责”从设计稿到图层”:把一张已经拍平的设计图拆成 2 到 9 个可以单独编辑的透明图层。

同一批开源的还有两个智能体技能包:Ling UI Design Skill,以及把图片转成可编辑 PPT 的 Image-to-Editable-PPT Skill。模型 API 在 OpenRouter 上开放两周免费调用。

它瞄准的是哪类图

通用文生图模型擅长画面,但一到按钮、卡片、多栏信息区这类”文字要准、位置要齐”的内容就容易露馅:字写错、对不齐、同一张图里配色前后不一致。Ming-Image-0.1-Design 把力气花在了这些地方。

按官方说明,Design 模型支持最长 8K token 的结构化提示词,一份写清了标题、按钮文案、卡片内容和配色的长需求可以整段塞进去;标题、按钮、多区域信息的文字渲染和版式稳定性做了专门加强;VAE 原生支持 RGBA,透明背景的元素可以直接生成出来。推荐输出分辨率 2048×2048,想快一点可以用 1024×1024。

Layer 模型解决的是另一头的问题。设计师拿到一张 AI 出的图,想改一个按钮的颜色,过去只能重新生成或者手工抠图;拆成图层以后,文字、背景、主体元素可以各自挪动和替换。

成绩和口径

第三方评测机构 Artificial Analysis 9 月 18 日更新的 UI/UX 设计专项榜单里,Ming-Image-0.1-Design 以 1082 分的 Elo 成绩排在开源权重模型第一。蚂蚁同时公布了三项分项数据:布局稳定性 67.4%、复杂构图 67.0%、文字渲染 66.7%。这三个百分比按什么方法统计、对照的是哪些模型,公开材料没有展开,读的时候以 Elo 排名为主要参考更稳妥。

Hugging Face 模型页上没有给出基础架构细节,也没有列出和闭源模型的直接对比。榜单排名限定在开源权重模型范围内,和闭源的商用设计生成工具相比处在什么位置,目前没有公开数据。

对国内团队意味着什么

先说门槛。官方验证过的运行配置是一张 80GB 显存的 CUDA 显卡,BF16 精度,也就是 A100、H100 这一级的数据中心卡。消费级显卡能不能跑、量化后效果掉多少,模型页没有写,本地部署的团队得自己测。想先看效果的,两周免费的 OpenRouter 接口是成本最低的入口。

再说许可。MIT 协议允许商用和二次开发,对需要把生成能力嵌进自家设计工具、营销物料系统的公司,法务上几乎没有额外负担。

和日常办公挨得最近的是那个 PPT 技能包。不少汇报材料靠”截图 + 手改”拼出来,一张图如果能被拆回可编辑的页面元素,省下的是反复返工的时间。实际还原度如何,要看拆出来的文字能不能直接改字、字体会不会被替换,这一点官方也没有给评测。

中文排版是另一个待验证项。蚂蚁的技能包资料里有中文设计示例,但模型页没有单列中文文字渲染的测试结果,做中文海报、中文界面的用户需要自己跑几轮再下判断。

参考来源:Hugging Face 模型页、IT之家、CocoLoop、Artificial Analysis;参数量、协议与显存配置以 Hugging Face 模型页为准,榜单排名与分项数据以 Artificial Analysis 及官方发布口径为准。