El equipo del modelo Bailing de Ant Group liberó en código abierto la serie Ming-Image-0.1-Design el 23 de septiembre, compuesta por dos modelos, ambos con 6.000 millones de parámetros (6B). El código y los pesos están alojados en Hugging Face, bajo la organización inclusionAI, con licencia MIT.
- Ming-Image-0.1-Design se encarga de ir "de texto a pieza de diseño": a partir de una descripción del encargo, genera interfaces de UI, paneles de datos, infografías y carteles, es decir, piezas completas centradas en la maquetación y el texto;
- Ming-Image-0.1-Design-Layer se encarga de ir "de pieza de diseño a capas": separa una imagen de diseño ya aplanada en 2 a 9 capas transparentes editables de forma independiente.
Junto con los modelos se liberaron dos paquetes de habilidades para agentes: Ling UI Design Skill, y Image-to-Editable-PPT Skill, que convierte imágenes en archivos de PPT editables. La API de los modelos está disponible de forma gratuita en OpenRouter durante dos semanas.
A qué tipo de imágenes apunta
Los modelos genéricos de texto a imagen son buenos generando composiciones visuales, pero suelen fallar justo en botones, tarjetas y zonas de información en varias columnas, donde el texto tiene que ser exacto y los elementos deben quedar alineados: palabras mal escritas, desalineaciones, colores inconsistentes dentro de la misma imagen. Ming-Image-0.1-Design centra su esfuerzo precisamente ahí.
Según la documentación oficial, el modelo Design admite prompts estructurados de hasta 8K tokens, lo que permite meter de una sola vez un encargo largo con título, textos de botones, contenido de tarjetas y paleta de colores ya definidos; se reforzó especialmente el renderizado de texto y la estabilidad del maquetado para títulos, botones y zonas de información con múltiples secciones, y el VAE admite RGBA de forma nativa, por lo que los elementos con fondo transparente pueden generarse directamente. La resolución de salida recomendada es 2048×2048, y para mayor velocidad puede usarse 1024×1024.
El modelo Layer resuelve el problema del otro extremo. Un diseñador que recibe una imagen generada por IA y solo quiere cambiar el color de un botón, antes solo podía volver a generarla entera o recortarla a mano; una vez separada en capas, el texto, el fondo y los elementos principales pueden moverse y sustituirse de forma independiente.
Resultados y matices
En la tabla de clasificación especializada en diseño UI/UX que la evaluadora independiente Artificial Analysis actualizó el 18 de septiembre, Ming-Image-0.1-Design obtuvo 1082 puntos Elo, quedando en primer lugar entre los modelos de pesos abiertos. Ant también publicó tres métricas parciales: estabilidad de maquetación 67,4%, composición compleja 67,0% y renderizado de texto 66,7%. No se ha detallado públicamente qué metodología se usó para calcular estos porcentajes ni con qué modelos se comparó, así que es más prudente tomar la clasificación Elo como referencia principal.
La página del modelo en Hugging Face no ofrece detalles sobre la arquitectura base ni comparaciones directas con modelos de código cerrado. Además, la clasificación se limita a modelos de pesos abiertos; su posición frente a herramientas comerciales cerradas de generación de diseño no cuenta por ahora con datos públicos.
Qué significa para los equipos en China
Primero, la barrera de entrada: la configuración verificada oficialmente es una sola tarjeta CUDA con 80 GB de VRAM en precisión BF16, es decir, hardware de centro de datos de la clase A100 o H100. Si las tarjetas de consumo pueden ejecutarlo y cuánto se pierde de calidad al cuantizar no está documentado en la página del modelo; los equipos que hagan despliegue local tendrán que probarlo por su cuenta. Para quienes solo quieran ver resultados primero, la API gratuita de dos semanas en OpenRouter es la vía de entrada más barata.
En cuanto a la licencia, MIT permite uso comercial y desarrollo derivado, lo que supone prácticamente ninguna carga legal adicional para empresas que quieran integrar esta capacidad de generación en sus propias herramientas de diseño o sistemas de material de marketing.
Lo que más se acerca al trabajo de oficina cotidiano es el paquete de habilidad para PPT. Muchos materiales de presentación hoy se montan a base de "captura de pantalla más edición manual"; si una imagen puede desmontarse de nuevo en elementos de página editables, se ahorra tiempo de retrabajo. La fidelidad real dependerá de si el texto extraído puede editarse directamente y si las fuentes tipográficas se mantienen sin sustituirse, algo que tampoco ha sido evaluado públicamente.
La tipografía en chino es otro punto pendiente de verificar. El material del paquete de habilidades de Ant incluye ejemplos de diseño en chino, pero la página del modelo no presenta resultados de prueba específicos para el renderizado de texto en chino; quienes vayan a crear carteles o interfaces en chino deberán hacer sus propias pruebas antes de sacar conclusiones.
Fuentes: página del modelo en Hugging Face, ITHome, CocoLoop, Artificial Analysis; los datos de parámetros, licencia y configuración de VRAM siguen la página del modelo en Hugging Face; la clasificación y las métricas parciales siguen a Artificial Analysis y el anuncio oficial.