Hugging Face recrea AUTOMATIC1111 con 73 nodos

El 10 de septiembre, Hugging Face publicó una entrada presentando Workflow1111, una reconstrucción hecha con Gradio Workflow que convierte todo el conjunto de funciones de AUTOMATIC1111 en un grafo de 11 pipelines de medios y 73 nodos. Los autores son Yuvraj Sharma y Abubakar Abid.

Para quien no haya seguido este terreno, AUTOMATIC1111 fue la interfaz gráfica local más usada de la era Stable Diffusion, y prácticamente definió los hábitos de uso de la generación de imágenes por IA durante esos dos años: prompts positivos y negativos, sampler, hires fix, image-to-image, plugins de ControlNet. Más adelante el foco de la comunidad se fue desplazando hacia ComfyUI, basado en nodos, pero la lista de funciones de A1111 siguió siendo de facto la referencia.

Qué funciones se recrearon

Los elementos recreados que enumera el artículo incluyen: texto a imagen con presets de estilo, hires fix (ampliación más una ronda de reducción de ruido), edición image-to-image, reescritura de prompts con un modelo grande, generación de descripciones a partir de imágenes, máscaras de repintado generadas mediante detección de objetos, matriz de prompts para generación por lotes, ampliación y eliminación de fondo, anotadores tipo ControlNet como Canny y dibujo de líneas, lectura/escritura de metadatos PNG, e imagen a video.

Los modelos que operan detrás incluyen FLUX.1-Kontext, Qwen2.5-VL, DETR, un clasificador ViT, BRIA RMBG-2.0 y Wan 2.2 I2V.

El propio Gradio Workflow define cuatro tipos de operadores: fn es una función de Python, model llama a un modelo a través de InferenceClient, space conecta directamente con otro Gradio Space, dataset toma filas de un dataset del Hub. De estos cuatro tipos, solo fn se ejecuta por completo en la propia máquina; la capacidad de cómputo de los otros tres está en otro lugar.

Reparto de funciones con ComfyUI

En la comparación que ofrece el artículo, varias diferencias son bastante concretas: un nodo puede ser un hardware que ni siquiera posees; cada salida se convierte automáticamente en un endpoint REST tipado; hay soporte para OAuth, así que basta con iniciar sesión en el navegador para usarlo; distintas modalidades pueden convivir en el mismo lienzo; los nodos personalizados son simplemente funciones de Python, y todo lo que Python puede hacer, esto también puede hacerlo.

El código mínimo para arrancar tiene solo tres líneas: importar gradio, escribir una función y gr.Workflow(bind=[your_function]).launch(). El despliegue se hace con gradio deploy hacia Spaces. Además, todo el workflow admite MCP, lo que significa que los agentes pueden invocarlo como una herramienta.

En cuanto a rendimiento, el artículo solo da una cifra: con las imágenes precargadas, cada anotador que corre en CPU tarda unos 0,5 segundos. La licencia no se menciona en el texto.

Qué significa esto para los usuarios en China

La utilidad práctica de todo esto depende de en qué lado te encuentres. Los 22 nodos totalmente locales significan que tareas como eliminar fondos, Canny, dibujo de líneas y metadatos pueden ejecutarse sin conexión, sin depender de la red. Pero los operadores de tipo model y space pasan por los endpoints de inferencia de Hugging Face, y la estabilidad de la conexión directa desde China ha sido siempre un problema, algo especialmente notorio al invocar modelos pesados como FLUX.1-Kontext y Wan 2.2.

Wan 2.2 es un modelo de generación de video de código abierto de Alibaba, que en China cuenta con ModelScope como vía de distribución más cercana. Es decir, la mayoría de los modelos de este grafo tienen un alojamiento equivalente disponible en China, pero el runtime de Workflow sigue atado al Hub por ahora; para cambiar de fuente hay que modificar el propio nodo fn para llamar a servicios locales o nacionales. No es que sea imposible, es simplemente trabajo de ingeniería adicional.

Desde la perspectiva de la evolución de las herramientas, el paso de A1111 a ComfyUI fue de formulario a grafo; este paso de Workflow1111 va de "el grafo corre en mi propia GPU" a "el grafo corre en la GPU de quien sea". Una vez que esa capa intermedia de abstracción se consolida, la VRAM local deja de ser un requisito para que algo funcione y pasa a ser una simple cuestión de costo. Si este diagnóstico se sostiene, se sabrá en uno o dos años observando la proporción entre nodos autogestionados y nodos alquilados dentro de la comunidad.

Fuentes: blog oficial de Hugging Face, documentación de Gradio, CocoLoop; el número de nodos, la clasificación de operadores y las cifras de tiempo se cotejaron con el artículo original, y la parte sobre disponibilidad en China es una valoración de la redacción.