26-köpfiges Team entwickelt Open-Source-Reasoning-Modell mit 40 Milliarden Parametern

Arcee AI ist ein kleines Unternehmen mit nur 26 Mitarbeitern, aber sie haben gerade etwas getan, das viele in der Branche überrascht hat: Sie haben etwa die Hälfte ihres Risikokapitals, 20 Millionen US-Dollar, ausgegeben, um mit 2048 Nvidia B300 GPUs in 33 Tagen ein Open-Source-Reasoning-Modell mit 40 Milliarden Parametern namens Trinity-Large-Thinking zu trainieren.

Die Agentenleistung des Modells ist beachtlich: Es erreichte den ersten Platz (88 Punkte) im Tau2-Airline-Benchmark, den zweiten Platz (91,9 Punkte) im PinchBench (Claude Opus 4.6 von Anthropic erreichte 93,3 Punkte) und 96,3 Punkte im AIME25-Mathe-Reasoning. Das gesamte Modell wird unter der Open-Source-Lizenz Apache 2.0 veröffentlicht, ist kommerziell nutzbar, herunterladbar und modifizierbar.

Nicht rohe Gewalt, sondern maximale Nutzung der MoE-Architektur

Trinity-Large-Thinking ist ein Mixture-of-Experts-Modell (MoE) mit insgesamt 40 Milliarden Parametern, von denen bei jeder Inferenz nur etwa 1,3 Milliarden aktiviert werden – es verwendet 256 Experten, von denen jeweils nur 4 aktiviert werden. Das bedeutet, dass das Modell über die "Wissensreserven" eines großen Modells verfügt, aber die Inferenzgeschwindigkeit und der Ressourcenverbrauch denen eines kleinen Modells nahekommen.

Die Trainingsdaten umfassen 17 Billionen Tokens, von denen über 8 Billionen synthetisch generiert wurden. Dieses Verhältnis ist bei heutigen hochwertigen Open-Source-Modellen bereits üblich.

Ein technischerer Höhepunkt ist ihr selbst entwickelter SMEBU-Algorithmus (Soft-clamped Momentum Expert Bias Updates), der speziell das Problem des "Expert Collapse" beim Training großer MoE-Modelle löst. Der gesamte Trainingsprozess über 17 Billionen Tokens verlief "ohne Verlustspitzen" – das ist bei großen Modelltrainings selten, da viele MoE-Modelle während des Trainings plötzliche Verlustexplosionen erleiden.

Stärken und Schwächen

Um ehrlich zu sein, übertrifft Trinity-Large-Thinking Claude Opus nicht in allen Bereichen, sondern punktet in spezifischen Szenarien.

Benchmark Trinity-Large-Thinking Claude Opus 4.6
Tau2-Airline 88 (Platz 1) Nicht veröffentlicht
PinchBench 91,9 (Platz 2) 93,3
AIME25 96,3
GPQA-Diamond 76,3 89,2
MMLU-Pro 83,4 89,1

Die Agentenleistung kann sich dem Spitzenniveau annähern, aber beim allgemeinen Reasoning gibt es noch eine Lücke von etwa 13 Prozentpunkten. Angesichts der Tatsache, dass es sich um ein Open-Source-Modell handelt, das lokal bereitgestellt werden kann, ist diese Lücke jedoch bereits sehr gering.

Darüber hinaus haben sie gleichzeitig Trinity-Large-TrueBase veröffentlicht – eine Version mit dem "rohen Checkpoint", der den reinen Vor-Trainingszustand vor der Instruktionsfeinabstimmung beibehält. Diese Version ist für diejenigen, die Grundlagenforschung zu KI betreiben, sehr wertvoll, da sie die spezifischen Auswirkungen von RLHF und Instruktionsfeinabstimmung auf das Modellverhalten untersuchen können.

Größerer Kontext: Die lange Abwesenheit von Open-Source-KI in den USA

Im vergangenen Jahr wurde die Rangliste der großen Open-Source-Modelle hauptsächlich von chinesischen Unternehmen dominiert: DeepSeek, Qwen, Kimi, GLM – alle paar Monate kam ein neues Modell auf den Markt. Auf US-amerikanischer Seite war Llama von Meta der einzige starke Vertreter, aber Meta hat kürzlich einige neue Modelle unter Verschluss gehalten, was in der Open-Source-Community auf Kritik stieß. Arcee füllt nun diese Lücke.

CEO Mark McQuade sagte, das Ziel des Modells seien Unternehmen: Es kann lokal bereitgestellt, angepasst werden, und Daten müssen nicht an Cloud-Dienstanbieter gesendet werden. Für Finanz-, Gesundheits- und Regierungsorganisationen mit Datenkonformitätsanforderungen ist die Eigenschaft "auf dem eigenen Server laufen zu können" manchmal nützlicher als Benchmark-Ergebnisse.

26 Menschen, 20 Millionen US-Dollar, 33 Tage, 40 Milliarden Parameter.

Die Geschichte, dass kleine Unternehmen Großes leisten, ist in der KI-Welt noch nicht tot.

Quellenangabe: Arcee AI spent half its venture capital to build an open reasoning model that rivals Claude Opus in agent tasks (The Decoder); Tiny startup Arcee AI built a 400B-parameter open source LLM from scratch to best Meta's Llama (TechCrunch); CocoLoop; Arcee aims to reboot U.S. open source AI with new Trinity models released under Apache 2.0 (VentureBeat)