Tencent macht Hunyuan Hy4 Preview quelloffen – knapper Sieg im Blindtest gegen GLM und Kimi

Tencent hat am 28. August das Modell Hunyuan Hy4 Preview veröffentlicht und quelloffen gemacht: insgesamt 770 Milliarden Parameter, davon 49 Milliarden pro Token aktiv, mit einem nativen Kontextfenster von 1.048.576 Token. Die Modellgewichte stehen unter der Apache-2.0-Lizenz auf Hugging Face, ModelScope und GitCode bereit und sind zugleich über Tencent Clouds TokenHub, OpenRouter sowie Tencents eigene Dienste WorkBuddy/CodeBuddy, Yuanbao und ima verfügbar. Tencent positioniert das Modell als „eine frühe Version in der Hy4-Iteration" und beansprucht offiziell, „fest in der ersten Reihe der Open-Source-Modelle" zu stehen.

Laut Modellkarte handelt es sich bei Hy4 Preview um ein typisches, stark spärlich besetztes MoE-Modell: Von 78 Schichten ist nur eine dichte FFN-Schicht, die übrigen 77 Schichten laufen über Experten-Routing, mit je 256 gerouteten Experten plus einem gemeinsamen Experten pro Schicht, wobei jedes Token acht geroutete Experten auswählt. Die Hidden-Layer-Breite liegt bei 6144, das Vokabular umfasst 120.832 Einträge. Der Attention-Mechanismus nutzt Gated Sparse Attention mit IndexCache, komprimiert Queries auf 2048 und Key-Value-Paare auf 512 Dimensionen und kombiniert das mit vier iHC-Residual-Strömen. Für das Deployment werden vLLM und SGLang unterstützt, spekulative MTP-Dekodierung ist standardmäßig aktiviert.

Hinter der Aktivierungsrate von 6,4 Prozent steckt eine Rechenkostenrechnung

49 Milliarden geteilt durch 770 Milliarden ergibt eine Aktivierungsrate von rund 6,4 Prozent. Diese Zahl ist der Schlüssel zum Verständnis der gesamten Preisgestaltung: Die Gesamtparameterzahl bestimmt Speicherbedarf und Ladekosten, die aktivierte Parameterzahl den tatsächlichen Rechenaufwand pro Token. Tencent hat beide Werte um mehr als das 15-Fache auseinandergezogen und dafür eine vergleichsweise moderate Preisliste erreicht: Eingabe kostet 6 Yuan pro Million Token (rund 0,834 US-Dollar), Ausgabe 18 Yuan (rund 2,501 US-Dollar), bei Cache-Treffer nur 0,3 Yuan.

Dieses Preisniveau liegt im chinesischen Open-Source-Lager im Mittelfeld. GLM-5.3-Flash, in derselben Woche veröffentlicht, bietet Eingabepreise von nur 0,075 US-Dollar pro Million Token – ein Elftel von Hy4 Preview –, ist aber ein leichtgewichtiges Modell mit nur 18 Milliarden aktiven Parametern. Hy4 Preview zielt dagegen auf schwerere Aufgaben wie dateiübergreifendes Codelesen und dokumentenübergreifende Analysen. Beide Modelle spielen nicht in derselben Liga, ein direkter Preisvergleich ergibt wenig Sinn.

Die eigentliche Kostenvariable steckt im 1-Millionen-Token-Kontext. Wird ein einzelner Input mit einer Million Token vollständig ausgefüllt, kostet das nach Listenpreis grob gerechnet rund 6 Yuan, bei Cache-Treffer sinkt es auf 0,3 Yuan – der Cache-Preis liegt bei nur einem Zwanzigstel des Originalpreises. Dieser Rabatt sagt Entwicklern im Grunde: Nutzt den langen Kontext als dauerhaften Arbeitsbereich, statt ihn jedes Mal neu zu übertragen.

Wie die 0,07 Punkte Differenz zu lesen sind

Tencents Blindtest-Ergebnis: 163 interne Experten bewerteten 203 Engineering-Aufgaben. Hy4 Preview erreichte im Schnitt 2,99 Punkte (von 4), GLM-5.3 kam auf 2,92, Kimi K3 auf 2,94.

Der Punkteunterschied ist gering, die Verteilung von Siegen und Niederlagen ist aussagekräftiger. Gegen GLM-5.3 gewann Hy4 Preview 46,8 Prozent, unentschieden 12,8 Prozent, verloren 40,4 Prozent; gegen Kimi K3 gewann es 51,2 Prozent, unentschieden 7,9 Prozent, verloren 40,9 Prozent. Die Verlustquote liegt in beiden Vergleichen bei rund 40 Prozent – bei fast der Hälfte der konkreten Aufgaben schnitt der jeweilige Gegner also besser ab. Die drei Modelle liegen dicht beieinander, keines setzt sich klar ab.

Zwei Einschränkungen darf man nicht übergehen: Die Juroren sind interne Experten von Tencent, und auch der Aufgabenpool wurde von Tencent zusammengestellt – ein solcher selbst organisierter Blindtest hat naturgemäß einen Heimvorteil. Bei einer Stichprobengröße von 203 Aufgaben ist die statistische Aussagekraft eines Unterschieds von 0,05 bis 0,07 Punkten zudem recht begrenzt.

Öffentliche Benchmarks erlauben einen belastbareren Vergleich: SWE-bench Multilingual 82,9, SWE-bench Pro 65,7, Terminal-Bench 2.1 erreicht 85,4, GPQA Diamond 92,3, HLE mit Tool-Unterstützung 55,4. SWE-bench Pro ist die Kategorie, in der alle Modelle am meisten Punkte verlieren – 65,7 zählt aktuell zur Spitzengruppe unter den Open-Source-Modellen.

Wette auf lang laufende Aufgaben

Tencent benennt die Hauptstoßrichtung des Modells unumwunden: lang laufendes Software-Engineering, dateiübergreifende Büroanalyse, Spieleentwicklung und wissenschaftliche Forschung. Das Modell bietet zwei Inferenzmodi, high und no_think – Ersterer für Szenarien mit langen Denkketten, Letzterer zum Sparen von Token.

Ein von Tencent selbst als Vorzeigebeispiel präsentierter Fall ist das dreidimensionale Blaschke-Lebesgue-Problem: Das Modell drückte die untere Volumengrenze von 0,380799 auf 0,41104 – nur noch rund 2 Prozent entfernt von der Meissner-Tetraeder-Vermutung mit 0,41986. Die Aussagekraft eines solchen sorgfältig ausgewählten Beispiels ist begrenzt, doch die Richtung ist klar: Tencent will Hy4 Preview in Forschungsworkflows bringen, nicht nur im Chatfenster halten.

Für Entwickler in China bedeutet das praktisch eine weitere Option. GLM-5.3, Kimi K3 und DeepSeek-V4-Pro haben den Bereich der offenen Long-Context-Modelle bereits stark besetzt; Hy4 Preview verschafft sich Platz durch die großzügige Apache-2.0-Lizenz und den fertigen Inferenzdienst von Tencent Cloud. Gerade der Lizenzpunkt ist entscheidend – viele chinesische Open-Source-Modelle enthalten kommerzielle Einschränkungsklauseln, während Apache 2.0 bedeutet, dass Unternehmen das Modell direkt anpassen, einsetzen und weiterverkaufen können, ohne eine separate Lizenz aushandeln zu müssen.

Am Ende bleibt eine Preview eine Preview. Tencent hat keinen Zeitplan für die finale Version von Hy4 genannt und auch nicht gesagt, wie groß der Unterschied zwischen Preview und finaler Version ausfallen wird.

Quellen: Tencent-Hunyuan-Tech-Blog, Hugging-Face-Modellkarte, ITHome, CocoLoop, DataLearner; Modellparameter, Blindtest-Methodik und API-Preise wurden anhand der offiziellen Modellkarte und Preisseite geprüft, die Preisumrechnung ist eine grobe Schätzung auf Basis der Listenpreise.