Ant Group macht zwei 6B-Design-Modelle quelloffen, bis zu 9 Ebenen

Das Bailing-Modellteam von Ant Group hat am 23. September die Modellreihe Ming-Image-0.1-Design als Open Source veröffentlicht – zwei Modelle mit jeweils 6 Milliarden Parametern (6B). Code und Gewichte liegen bei Hugging Face unter der Organisation inclusionAI, lizenziert unter MIT.

  • Ming-Image-0.1-Design übernimmt den Weg "von Text zu Design": Aus einer Beschreibung der Anforderungen erzeugt es vollständige, layout- und textlastige Designs wie UI-Oberflächen, Dashboards, Infografiken und Poster;
  • Ming-Image-0.1-Design-Layer übernimmt den Weg "von Design zu Ebenen": Es zerlegt ein bereits flach gerendertes Design in 2 bis 9 einzeln bearbeitbare, transparente Ebenen.

Zusammen mit den Modellen wurden zwei Agent-Skill-Pakete veröffentlicht: das Ling UI Design Skill sowie das Image-to-Editable-PPT Skill, das Bilder in editierbare PowerPoint-Dateien umwandelt. Die Modell-API steht zwei Wochen lang kostenlos über OpenRouter zur Verfügung.

Auf welche Art von Bildern es zielt

Klassische Text-zu-Bild-Modelle sind stark bei reinen Bildinhalten, geraten aber bei Buttons, Karten und mehrspaltigen Informationsbereichen ins Straucheln, wo Text exakt stimmen und Elemente sauber ausgerichtet sein müssen: falsch geschriebene Wörter, Versätze, inkonsistente Farbgebung innerhalb desselben Bildes. Genau darauf hat Ant bei Ming-Image-0.1-Design den Fokus gelegt.

Laut offizieller Beschreibung unterstützt das Design-Modell strukturierte Prompts mit bis zu 8K Token – eine ausführliche Anforderung mit Titel, Button-Texten, Karteninhalten und Farbschema lässt sich komplett hineinpacken. Textrendering und Layout-Stabilität für Titel, Buttons und mehrteilige Informationsbereiche wurden gezielt verbessert, und die VAE unterstützt nativ RGBA, sodass transparente Hintergrundelemente direkt erzeugt werden können. Empfohlen wird eine Ausgabeauflösung von 2048×2048, für mehr Tempo genügt 1024×1024.

Das Layer-Modell löst das umgekehrte Problem. Wer ein KI-generiertes Bild bekommt und nur die Farbe eines Buttons ändern möchte, musste bisher entweder neu generieren oder manuell freistellen. Nach der Zerlegung in Ebenen lassen sich Text, Hintergrund und Hauptelemente unabhängig voneinander verschieben und ersetzen.

Ergebnisse und Einordnung

Im UI/UX-Design-Ranking, das der unabhängige Bewertungsdienst Artificial Analysis am 18. September aktualisiert hat, erreichte Ming-Image-0.1-Design einen Elo-Wert von 1082 Punkten und belegt damit Platz eins unter den Modellen mit offen zugänglichen Gewichten. Ant hat zusätzlich drei Teilwerte veröffentlicht: Layout-Stabilität 67,4 %, komplexe Kompositionen 67,0 % und Textrendering 66,7 %. Nach welcher Methodik diese Prozentwerte ermittelt wurden und mit welchen Modellen verglichen wurde, geht aus den öffentlichen Unterlagen nicht hervor – für die Einordnung ist daher in erster Linie das Elo-Ranking maßgeblich.

Die Modellseite auf Hugging Face nennt keine Details zur Basisarchitektur und enthält keinen direkten Vergleich mit Closed-Source-Modellen. Das Ranking ist zudem auf Open-Weight-Modelle beschränkt; wo das Modell im Vergleich zu kommerziellen Closed-Source-Designtools steht, ist derzeit nicht öffentlich belegt.

Was das für Teams in China bedeutet

Zunächst zur Einstiegshürde: Die offiziell verifizierte Konfiguration ist eine einzelne CUDA-Grafikkarte mit 80 GB VRAM bei BF16-Genauigkeit – also Hardware der Klasse A100 oder H100 aus dem Rechenzentrum. Ob Consumer-Grafikkarten ausreichen und wie stark die Qualität bei Quantisierung sinkt, ist auf der Modellseite nicht dokumentiert; Teams mit eigenem Betrieb müssen das selbst testen. Wer die Ergebnisse zunächst nur sehen will, kommt über die zwei Wochen kostenlose OpenRouter-API am günstigsten heran.

Bei der Lizenz erlaubt MIT sowohl kommerzielle Nutzung als auch Weiterentwicklung – für Unternehmen, die die Generierungsfähigkeit in eigene Design-Tools oder Marketing-Systeme einbetten wollen, entsteht dadurch juristisch kaum zusätzlicher Aufwand.

Am nächsten am Büroalltag liegt das PPT-Skill-Paket. Viele Präsentationsunterlagen entstehen bisher aus "Screenshot plus manueller Nachbearbeitung"; lässt sich ein Bild wieder in editierbare Seitenelemente zerlegen, spart das wiederholte Nacharbeit. Wie gut das in der Praxis funktioniert, hängt davon ab, ob sich der extrahierte Text direkt bearbeiten lässt und ob Schriftarten dabei ersetzt werden – auch dazu liegt keine offizielle Auswertung vor.

Chinesische Typografie ist ein weiterer offener Punkt. In den Materialien zum Skill-Paket von Ant finden sich chinesische Design-Beispiele, doch die Modellseite weist keine gesonderten Testergebnisse zum Rendering chinesischer Schriftzeichen aus. Wer chinesischsprachige Poster oder Oberflächen erstellen will, sollte selbst mehrere Durchläufe testen, bevor er ein Urteil fällt.

Quellen: Hugging-Face-Modellseite, ITHome, CocoLoop, Artificial Analysis; Angaben zu Parametern, Lizenz und VRAM-Konfiguration nach der Hugging-Face-Modellseite, Ranking und Teilwerte nach Artificial Analysis und der offiziellen Ankündigung.