Ant Group ouvre deux modèles de design 6B, jusqu'à 9 calques

L'équipe du modèle Bailing d'Ant Group a mis en open source le 23 septembre la série Ming-Image-0.1-Design, composée de deux modèles, tous deux dotés de 6 milliards de paramètres (6B). Le code et les poids sont hébergés sur Hugging Face, sous l'organisation inclusionAI, avec une licence MIT.

  • Ming-Image-0.1-Design prend en charge le trajet « du texte à la maquette » : à partir d'une description du besoin, il génère des interfaces UI, des tableaux de bord, des infographies et des affiches — des créations complètes centrées sur la mise en page et le texte ;
  • Ming-Image-0.1-Design-Layer prend en charge le trajet « de la maquette aux calques » : il sépare une image de design déjà aplatie en 2 à 9 calques transparents éditables indépendamment.

En même temps que les modèles, deux packs de compétences pour agents ont été publiés : Ling UI Design Skill, et Image-to-Editable-PPT Skill, qui transforme une image en fichier PPT modifiable. L'API des modèles est accessible gratuitement sur OpenRouter pendant deux semaines.

Quel type d'images il vise

Les modèles texte-image généralistes excellent dans le rendu visuel, mais trébuchent justement sur les boutons, les cartes et les zones d'information multi-colonnes, où le texte doit être exact et les éléments bien alignés : mots mal orthographiés, désalignements, couleurs incohérentes au sein d'une même image. C'est exactement là-dessus que Ming-Image-0.1-Design concentre ses efforts.

Selon la documentation officielle, le modèle Design gère des prompts structurés allant jusqu'à 8K tokens, ce qui permet d'y placer en une fois une demande détaillée précisant titre, textes des boutons, contenu des cartes et palette de couleurs ; le rendu du texte et la stabilité de la mise en page pour les titres, boutons et zones d'information à plusieurs sections ont été spécifiquement renforcés, et le VAE prend nativement en charge le RGBA, si bien que les éléments à fond transparent peuvent être générés directement. La résolution de sortie recommandée est 2048×2048, et 1024×1024 permet d'aller plus vite.

Le modèle Layer résout le problème inverse. Un designer qui reçoit une image générée par IA et veut simplement changer la couleur d'un bouton ne pouvait auparavant que régénérer l'ensemble ou découper à la main ; une fois séparés en calques, le texte, l'arrière-plan et les éléments principaux peuvent être déplacés et remplacés indépendamment les uns des autres.

Résultats et nuances

Dans le classement spécialisé en design UI/UX mis à jour le 18 septembre par l'évaluateur indépendant Artificial Analysis, Ming-Image-0.1-Design a obtenu 1082 points Elo, se classant premier parmi les modèles à poids ouverts. Ant a également publié trois indicateurs détaillés : stabilité de la mise en page 67,4 %, composition complexe 67,0 % et rendu du texte 66,7 %. La méthodologie utilisée pour calculer ces pourcentages, ainsi que les modèles servant de comparaison, ne sont pas précisés publiquement ; il est donc plus prudent de considérer le classement Elo comme la référence principale.

La page du modèle sur Hugging Face ne détaille pas l'architecture de base et ne propose pas de comparaison directe avec des modèles à code fermé. Le classement se limite par ailleurs aux modèles à poids ouverts ; sa position par rapport aux outils commerciaux fermés de génération de design ne fait l'objet d'aucune donnée publique à ce jour.

Ce que cela signifie pour les équipes en Chine

D'abord, le seuil d'accès : la configuration vérifiée officiellement est une seule carte CUDA avec 80 Go de VRAM en précision BF16, soit du matériel de datacenter de la classe A100 ou H100. La documentation ne dit rien sur la capacité des cartes grand public à faire tourner le modèle, ni sur la perte de qualité après quantification ; les équipes qui déploient en interne devront tester elles-mêmes. Pour qui veut d'abord voir les résultats, l'API gratuite pendant deux semaines sur OpenRouter est la porte d'entrée la moins coûteuse.

Côté licence, MIT autorise l'usage commercial et le développement dérivé, ce qui ne crée pratiquement aucune charge juridique supplémentaire pour les entreprises souhaitant intégrer cette capacité de génération dans leurs propres outils de design ou systèmes de supports marketing.

Ce qui se rapproche le plus du travail de bureau quotidien, c'est le pack de compétence PPT. De nombreux supports de présentation sont aujourd'hui assemblés à coups de « capture d'écran plus retouche manuelle » ; si une image peut être redécomposée en éléments de page modifiables, cela fait gagner du temps sur les reprises. La fidélité réelle dépendra de la possibilité de modifier directement le texte extrait et de savoir si les polices sont remplacées au passage — un point sur lequel aucune évaluation officielle n'a non plus été publiée.

La typographie chinoise reste un autre point à vérifier. Les documents du pack de compétences d'Ant contiennent des exemples de design en chinois, mais la page du modèle ne présente pas de résultats de test spécifiques pour le rendu des caractères chinois ; les utilisateurs qui produisent des affiches ou des interfaces en chinois devront faire plusieurs essais avant de se prononcer.

Sources : page du modèle sur Hugging Face, ITHome, CocoLoop, Artificial Analysis ; les données sur les paramètres, la licence et la configuration VRAM suivent la page du modèle Hugging Face, tandis que le classement et les indicateurs détaillés suivent Artificial Analysis et l'annonce officielle.