Hugging Face recrée AUTOMATIC1111 avec 73 nœuds

Le 10 septembre, Hugging Face a publié un article présentant Workflow1111, une reconstruction réalisée avec Gradio Workflow qui transpose l'ensemble des fonctionnalités d'AUTOMATIC1111 en un graphe de 11 pipelines média et 73 nœuds. Les auteurs sont Yuvraj Sharma et Abubakar Abid.

Pour les lecteurs qui n'ont pas suivi ce sujet, AUTOMATIC1111 était l'interface graphique locale la plus utilisée de l'ère Stable Diffusion, définissant quasiment les habitudes d'usage de la génération d'images par IA pendant ces deux années : prompts positifs/négatifs, sampler, hires fix, image-to-image, plugins ControlNet. Par la suite, la communauté s'est progressivement tournée vers ComfyUI, basé sur des nœuds, mais la liste des fonctionnalités d'A1111 est restée de facto la référence.

Quelles fonctionnalités ont été reprises

Les éléments recréés listés dans l'article comprennent : le texte-vers-image avec préréglages de style, le hires fix (agrandissement suivi d'une passe de débruitage), l'édition image-to-image, la réécriture de prompts par un grand modèle de langage, la génération de description à partir d'une image, des masques de retouche générés par détection d'objets, une matrice de prompts pour la génération par lots, l'agrandissement et le détourage d'arrière-plan, des annotateurs de type ControlNet comme Canny et le dessin au trait, la lecture/écriture de métadonnées PNG, ainsi que l'image-to-video.

Les modèles mobilisés en coulisses incluent FLUX.1-Kontext, Qwen2.5-VL, DETR, un classificateur ViT, BRIA RMBG-2.0 et Wan 2.2 I2V.

Gradio Workflow définit lui-même quatre types d'opérateurs : fn est une fonction Python, model appelle un modèle via InferenceClient, space se connecte directement à un autre Gradio Space, dataset récupère des lignes d'un jeu de données sur le Hub. Parmi ces quatre types, seul fn s'exécute entièrement sur sa propre machine, la puissance de calcul des trois autres se trouvant ailleurs.

Répartition des rôles avec ComfyUI

Dans la comparaison proposée par l'article, plusieurs différences sont assez concrètes : un nœud peut être un matériel que l'on ne possède pas soi-même ; chaque sortie devient automatiquement un endpoint REST typé ; l'OAuth est pris en charge, une simple connexion via le navigateur suffisant pour l'utiliser ; différentes modalités peuvent cohabiter sur le même canevas ; les nœuds personnalisés ne sont que des fonctions Python, et tout ce que Python sait faire, le système le sait faire aussi.

Le code minimal pour démarrer ne tient qu'en trois lignes : importer gradio, écrire une fonction, puis gr.Workflow(bind=[your_function]).launch(). Le déploiement se fait via gradio deploy vers Spaces. Par ailleurs, l'ensemble du workflow prend en charge MCP, ce qui signifie que des agents peuvent l'appeler comme un outil.

Côté performance, l'article ne donne qu'un seul chiffre : une fois les images préchargées, chaque annotateur tournant sur CPU prend environ 0,5 seconde. La licence n'est pas précisée dans le texte.

Ce que cela signifie pour les utilisateurs en Chine

L'utilité pratique de l'ensemble dépend du côté où l'on se trouve. Les 22 nœuds purement locaux signifient que des tâches comme le détourage, Canny, le dessin au trait ou les métadonnées peuvent s'exécuter hors ligne, sans dépendre du réseau. Mais les opérateurs de type model et space passent par les endpoints d'inférence de Hugging Face, et la stabilité d'une connexion directe depuis la Chine a toujours posé problème, ce qui est particulièrement sensible pour des modèles lourds comme FLUX.1-Kontext et Wan 2.2.

Wan 2.2 est un modèle de génération vidéo open source d'Alibaba, pour lequel il existe en Chine une voie de distribution plus proche via ModelScope. Autrement dit, la plupart des modèles présents dans ce graphe disposent d'un hébergement équivalent en Chine, mais le runtime de Workflow reste pour l'instant lié au Hub : changer de source implique de modifier soi-même le nœud fn pour appeler des services locaux ou nationaux. Ce n'est pas infaisable, cela représente simplement un travail d'ingénierie supplémentaire.

Du point de vue de l'évolution des outils, le passage d'A1111 à ComfyUI a été celui du formulaire au graphe ; l'étape Workflow1111 va quant à elle de "le graphe tourne sur ma carte graphique" à "le graphe tourne sur la carte graphique de n'importe qui". Une fois cette couche d'abstraction intermédiaire établie, la VRAM locale cesse d'être une condition de fonctionnement pour devenir une simple option de coût. Que ce diagnostic tienne ou non, on le saura d'ici un an ou deux en observant, au sein de la communauté, la proportion entre nœuds auto-hébergés et nœuds loués.

Sources : blog officiel de Hugging Face, documentation Gradio, CocoLoop ; le nombre de nœuds, la classification des opérateurs et les chiffres de temps ont été vérifiés d'après l'article original, la partie sur la disponibilité en Chine relève d'une appréciation de la rédaction.