Qwen3.8-Max ist von der Ankündigung in ein reales Repository gewechselt. Am 12. August zeigte ModelScope für Qwen/Qwen3.8-2.4T-A95B ein veröffentlichtes Modell mit post-trainierten Gewichten und Konfigurationsdateien im Hugging-Face-Transformers-Format.
Die Modellkarte nennt vLLM, SGLang und TokenSpeed als kompatible Serving-Pfade. Die ModelScope-Metadaten weisen rund 4,89TB Speichergröße aus. Qwen3.8-Max war bereits über Qoder und Token Plan verfügbar; neu ist das offene Max-Klasse-Artefakt.
Die Gewichte werden zum Prüfpunkt
“This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format.”
Zu den Eckdaten gehören 2,4T Gesamtparameter, 95B aktive Parameter, 262.144 native Kontext-Token und eine Erweiterung auf 1.010.000 Token. Die Architektur umfasst 92 Schichten, 512 Experten, 10 routed experts plus einen shared expert und ein Vokabular von 248.320 Token.
Die offene Version ist nicht identisch mit dem gemanagten Qwen3.8-Max-Dienst. Das ModelScope-Modell ist textbasiert und verlangt thinking mode; Qwen Cloud ergänzt visuelle Eingaben, Non-thinking-Modus, standardmäßig 1M Kontext und integrierte Werkzeuge.
Kontrolle zählt mehr als Rabatt
Für Entwicklerteams ist ein API-Rabatt nicht dasselbe wie offene Gewichte. Rabatte laufen aus; Gewichte erlauben Tests von Inferenz-Engines, Quantisierung, privaten Codebasen, langen Dokumenten und Berechtigungstrennung in eigener Umgebung.
Die Größe von 4,89TB zeigt zugleich die Grenze. Das ist kein beiläufiges Laptop-Modell. Viele Nutzer werden es über Hosted Inference, quantisierte Builds oder Unternehmenscluster verwenden. Der Wert liegt in externer Reproduktion und Engine-Optimierung.
Offizielle Werte nennen 86,6 auf Terminal Bench 2.1, 67,7 auf SWE-bench Pro, 93,0 auf PaperBench und 86,1 auf OSWorld-Verified. Doch Harnesses, Zeitlimits, Kontextfenster und Baseline-Quellen unterscheiden sich. Als Nächstes zählen Lizenzklarheit, stabile Downloads, vLLM- und SGLang-Rezepte, unabhängige Benchmarks und Leistung nach Quantisierung.
Quellen: ModelScope-Modellkarte Qwen3.8-2.4T-A95B, offizieller Qwen3.8-Max-Blog, Qwen-Cloud-Modellhinweise, DataCamp, CocoLoop; geprüft wurden Open-Weight-Status, Repository-Größe, Gesamt- und Aktivparameter, Kontextlänge, Framework-Kompatibilität, thinking-mode-Grenzen, Benchmarks und Unterschiede zum Managed API.