Em 10 de setembro, a Hugging Face publicou um artigo apresentando o Workflow1111, uma reconstrução feita com o Gradio Workflow que transforma todo o conjunto de funcionalidades do AUTOMATIC1111 em um grafo com 11 pipelines de mídia e 73 nós. Os autores são Yuvraj Sharma e Abubakar Abid.
Para quem não acompanhou essa linha, o AUTOMATIC1111 foi a interface gráfica local mais usada da era Stable Diffusion, definindo praticamente os hábitos de uso da geração de imagens por IA naqueles dois anos: prompts positivos/negativos, sampler, hires fix, image-to-image, plugins ControlNet. Depois o foco da comunidade migrou gradualmente para o ComfyUI, baseado em nós, mas a lista de funcionalidades do A1111 continuou sendo, na prática, a referência.
Quais funcionalidades foram recriadas
Os itens recriados listados no artigo incluem: text-to-image com presets de estilo, hires fix (upscaling com uma rodada extra de denoising), edição image-to-image, reescrita de prompts com um modelo de linguagem grande, geração de descrição a partir de imagem, máscaras de repintura geradas por detecção de objetos, matriz de prompts para geração em lote, upscaling e remoção de fundo, anotadores do tipo ControlNet como Canny e line art, leitura/gravação de metadados PNG, e image-to-video.
Os modelos usados por trás incluem FLUX.1-Kontext, Qwen2.5-VL, DETR, um classificador ViT, BRIA RMBG-2.0 e Wan 2.2 I2V.
O próprio Gradio Workflow define quatro tipos de operadores: fn é uma função Python, model chama um modelo via InferenceClient, space conecta diretamente a outro Gradio Space, dataset lê linhas de um dataset no Hub. Desses quatro tipos, apenas fn roda inteiramente na própria máquina; o poder computacional dos outros três está em outro lugar.
Divisão de papéis com o ComfyUI
Na comparação apresentada no artigo, algumas diferenças são bem concretas: um nó pode ser um hardware que você nem possui; cada saída vira automaticamente um endpoint REST tipado; há suporte a OAuth, bastando login pelo navegador para usar; diferentes modalidades podem conviver no mesmo canvas; nós personalizados são simplesmente funções Python — tudo que Python faz, ele também faz.
O código mínimo para começar tem só três linhas: importar o gradio, escrever uma função e gr.Workflow(bind=[your_function]).launch(). O deploy é feito com gradio deploy, enviando para o Spaces. Além disso, todo o workflow tem suporte a MCP, o que significa que agentes podem chamá-lo como ferramenta.
Sobre desempenho, o artigo dá apenas um número: com as imagens pré-carregadas, cada anotador rodando em CPU leva cerca de 0,5 segundo. A licença não é mencionada no texto.
O que isso significa para usuários na China
A viabilidade prática dessa ferramenta depende de qual lado você está. Os 22 nós totalmente locais significam que tarefas como remoção de fundo, Canny, line art e metadados podem rodar offline, sem depender da rede. Mas os operadores dos tipos model e space passam pelos endpoints de inferência da Hugging Face, e a estabilidade da conexão direta a partir da China sempre foi um problema, especialmente perceptível ao chamar modelos pesados como FLUX.1-Kontext e Wan 2.2.
O Wan 2.2 é um modelo de geração de vídeo de código aberto da Alibaba, que na China tem no ModelScope um canal de distribuição mais próximo. Ou seja, a maioria dos modelos presentes nesse grafo tem hospedagem equivalente disponível na China, mas o runtime do Workflow ainda está atrelado ao Hub — trocar de fonte exige editar o próprio nó fn para chamar serviços locais ou nacionais. Não é impossível, apenas representa trabalho de engenharia extra.
Do ponto de vista da evolução das ferramentas, a passagem do A1111 para o ComfyUI foi de formulário para grafo; este passo do Workflow1111 vai de "o grafo roda na minha placa de vídeo" para "o grafo roda na placa de vídeo de qualquer um". Uma vez estabelecida essa camada de abstração intermediária, a VRAM local deixa de ser pré-requisito para funcionar e passa a ser apenas uma opção de custo. Se esse diagnóstico se sustenta, dá para saber em um ou dois anos observando a proporção entre nós autogerenciados e nós alugados na comunidade.
Fontes: blog oficial da Hugging Face, documentação do Gradio, CocoLoop; número de nós, classificação de operadores e números de tempo foram conferidos com o artigo original, a parte sobre disponibilidade na China é avaliação da redação.