Ant Group libera dois modelos de design 6B em código aberto, com até 9 camadas

A equipe do modelo Bailing da Ant Group abriu o código da série Ming-Image-0.1-Design em 23 de setembro, composta por dois modelos, ambos com 6 bilhões de parâmetros (6B). O código e os pesos estão no Hugging Face, sob a organização inclusionAI, com licença MIT.

  • Ming-Image-0.1-Design cuida do caminho "de texto para peça de design": a partir de uma descrição do pedido, gera interfaces de UI, painéis de dados, infográficos e cartazes — peças completas centradas em layout e texto;
  • Ming-Image-0.1-Design-Layer cuida do caminho "de peça de design para camadas": separa uma imagem de design já achatada em 2 a 9 camadas transparentes editáveis de forma independente.

Junto com os modelos, foram liberados dois pacotes de habilidades para agentes: o Ling UI Design Skill e o Image-to-Editable-PPT Skill, que transforma imagens em arquivos de PPT editáveis. A API dos modelos está disponível gratuitamente na OpenRouter por duas semanas.

Que tipo de imagem o modelo mira

Modelos genéricos de texto para imagem são bons em composição visual, mas tropeçam justamente em botões, cartões e áreas de informação em várias colunas — conteúdo que exige texto correto e alinhamento preciso: palavras escritas errado, elementos desalinhados, cores inconsistentes dentro da mesma imagem. É exatamente nesses pontos que o Ming-Image-0.1-Design concentra esforço.

Segundo a documentação oficial, o modelo Design suporta prompts estruturados de até 8K tokens, permitindo colocar de uma vez um pedido longo com título, texto dos botões, conteúdo dos cartões e paleta de cores definidos; a renderização de texto e a estabilidade de layout para títulos, botões e áreas de informação com múltiplas regiões receberam reforço específico, e o VAE suporta RGBA nativamente, permitindo gerar diretamente elementos com fundo transparente. A resolução de saída recomendada é 2048×2048, podendo usar 1024×1024 para maior velocidade.

O modelo Layer resolve o problema do outro lado. Um designer que recebe uma imagem gerada por IA e quer só mudar a cor de um botão antes só podia gerar tudo de novo ou recortar manualmente; depois de separada em camadas, texto, fundo e elementos principais podem ser movidos e substituídos de forma independente.

Resultados e ressalvas

No ranking especializado em design de UI/UX atualizado em 18 de setembro pela avaliadora independente Artificial Analysis, o Ming-Image-0.1-Design obteve 1082 pontos de Elo, ficando em primeiro lugar entre os modelos de pesos abertos. A Ant também divulgou três métricas específicas: estabilidade de layout 67,4%, composição complexa 67,0% e renderização de texto 66,7%. A metodologia usada para calcular esses percentuais e quais modelos serviram de comparação não foram detalhados publicamente, então o mais seguro é usar o ranking de Elo como referência principal.

A página do modelo no Hugging Face não traz detalhes da arquitetura base nem comparação direta com modelos de código fechado. O ranking também se limita a modelos de pesos abertos; a posição em relação a ferramentas comerciais fechadas de geração de design não tem dados públicos até o momento.

O que isso significa para equipes na China

Primeiro, a barreira de entrada: a configuração verificada oficialmente é uma única placa CUDA com 80 GB de VRAM, em precisão BF16 — ou seja, hardware de data center da classe A100 ou H100. Se placas de consumo conseguem rodar o modelo e quanto a qualidade cai com quantização não está documentado; equipes que fizerem deploy local terão que testar por conta própria. Para quem só quer ver o resultado primeiro, a API gratuita de duas semanas na OpenRouter é a porta de entrada mais barata.

Sobre a licença, o MIT permite uso comercial e desenvolvimento derivado, o que representa praticamente nenhum ônus jurídico extra para empresas que queiram embutir essa capacidade de geração em suas próprias ferramentas de design ou sistemas de material de marketing.

O que fica mais próximo do dia a dia de escritório é o pacote de habilidade de PPT. Muitos materiais de apresentação hoje são montados na base de "print + edição manual"; se uma imagem pode ser desmontada de volta em elementos de página editáveis, isso economiza tempo de retrabalho. A fidelidade real vai depender de o texto extraído poder ser editado diretamente e de as fontes não serem substituídas — algo que a Ant também não avaliou publicamente.

A tipografia em chinês é outro ponto a verificar. O material do pacote de habilidades da Ant traz exemplos de design em chinês, mas a página do modelo não lista resultados de teste específicos para renderização de texto em chinês; quem for produzir cartazes ou interfaces em chinês precisa rodar alguns testes antes de tirar conclusões.

Fontes: página do modelo no Hugging Face, ITHome, CocoLoop, Artificial Analysis; dados de parâmetros, licença e configuração de VRAM seguem a página do modelo no Hugging Face; ranking e métricas específicas seguem a Artificial Analysis e o anúncio oficial.