Reflection AI hat sein erstes offenes Modell veröffentlicht: Beam. Es handelt sich um ein spärlich besetztes Mixture-of-Experts-Modell (MoE) mit insgesamt 501 Milliarden Parametern, von denen pro Token 23 Milliarden aktiv sind. Der Fokus liegt auf Coding, Reasoning und Agentenaufgaben. Das Unternehmen kündigt an, Gewichte, technischen Report und Modellkarte noch im laufenden Monat unter der Apache-2.0-Lizenz zu veröffentlichen; aktuell läuft noch die letzte Runde von Red-Teaming und Evaluierung. Entwickler können sich bereits jetzt über platform.reflection.ai für einen Vorabzugang bewerben.
Reflection wurde von ehemaligen DeepMind-Forschern gegründet und arbeitete über ein Jahr im Stealth-Modus. Im Juni schloss das Unternehmen mit SpaceX einen Rechenleistungs-Deal über insgesamt rund 6,3 Milliarden US-Dollar ab, umgerechnet etwa 150 Millionen Dollar pro Monat.
Wie Beam trainiert wurde
Laut offiziellem Blogbeitrag besteht Beam aus 52 Schichten; in einer mittleren Trainingsphase wurde das Kontextfenster auf 1 Million Token erweitert. Für das Pretraining kamen 23,8 Billionen Token zum Einsatz, stammend aus öffentlichen Webdaten und lizenzierten Datensätzen. Rohe Web-Token wurden mehrstufig gefiltert, wobei rund 95 Prozent aussortiert wurden.
Beim Rechenaufwand lief das Pretraining auf 6.144 Nvidia-GB300-GPUs knapp unter vier Wochen. Die anschließende Reinforcement-Learning-Phase wechselte auf 10.500 GB300-GPUs und lief weitere vier Wochen, wobei mehr als 100 Millionen Rollouts erzeugt und rund 1,3 Milliarden Sandbox-Umgebungen genutzt wurden. Reflection zeigt sich beim Umfang dieses RL-Laufs sehr selbstbewusst:
"We believe this is one of the largest scale RL runs conducted by any open lab to date."
Auf Deutsch: Das Unternehmen geht davon aus, einen der bislang größten Reinforcement-Learning-Läufe durchgeführt zu haben, die je von einem offenen Labor durchgeführt wurden. Laut Blog stiegen die Fähigkeiten des Modells mit zunehmendem RL-Rechenaufwand durchgehend weiter an – ein Plateau sei nicht erkennbar gewesen.
Im Vergleich mit chinesischen Open-Source-Modellen
Reflection vergleicht Beam fast ausschließlich mit chinesischen Modellen, und das ganz offen. In der offiziellen Vergleichstabelle liegt Beam auf Augenhöhe mit Zhipus GLM 5.2, beansprucht dabei aber nur ein Viertel bis ein Drittel der Inferenz-Rechenleistung des Konkurrenten. Bei Coding- und Agentenaufgaben will man nahe an Qwen 3.8-Max heranreichen, einem Modell mit über 2 Billionen Parametern.
Einige Werte im Überblick:
| Benchmark | Beam | Vergleichswert |
|---|---|---|
| SWE-bench Verified | 80,9 | Inkling 77,6 |
| Terminal Bench v2.1 | 80,1 | DeepSeek V4.1 Flash 90,6 |
| SWE Bench Pro v2-Hard | 77,2 | Kimi K3 88,2 |
| BrowseComp (mit Kontext) | 77,4 | Kimi K3 91,2 |
| GPQA Diamond | 90,5 | Kimi K3 93,5 |
In dieser Tabelle gewinnt Beam nur bei wenigen Kategorien. Bei Terminal-Operationen, anspruchsvollem Software-Engineering und Websuche liegen Kimi K3 und DeepSeek V4.1 Flash jeweils rund zehn Punkte vorn. Reflections Hauptargument ist Effizienz: Mit 23 Milliarden aktiven Parametern – vergleichsweise wenig für diese Punktzahlen – soll der Betrieb deutlich günstiger ausfallen.
In internationalen Medien wird die Geschichte oft so erzählt: ein US-Start-up, das erstmals ein Modell vorlegt, das mit Chinas führenden Open-Source-Modellen direkt konkurrieren kann. Seit über einem Jahr dominieren DeepSeek, Qwen, Kimi und GLM die Spitze der Open-Weight-Rankings; auf US-Seite hat Meta seinen Schwerpunkt auf die geschlossene Muse-Reihe verlegt, sodass kaum große offene Modelle übrig blieben. Beam soll genau diese Lücke schließen.
Offene Fragen
Alle oben genannten Werte stammen aus Reflections eigenen Evaluierungen; Details zu Testaufbau und Sampling-Anzahl müssen bis zum technischen Report warten. Da die Gewichte noch nicht veröffentlicht sind, kann die Community die Ergebnisse bislang nicht unabhängig nachprüfen.
Der Blogbeitrag nennt keine API-Preise und macht keine Angaben dazu, auf welchen Inference-Plattformen das Modell zuerst erscheinen wird – lediglich "Ökosystem-Vertriebspartner" werden erwähnt. Die Apache-2.0-Lizenz erlaubt nach der Veröffentlichung freie kommerzielle Nutzung und Fine-Tuning, doch der Speicherbedarf für die vollständigen 501 Milliarden Parameter bleibt hoch. Die meisten Teams werden wohl auf quantisierte Varianten oder Hosting-Angebote von Drittanbietern warten müssen.
Quellen: offizieller Blog von Reflection AI, Latent Space, CocoLoop, SiliconANGLE; Angaben zu Parametergröße, Trainingsrechenleistung und Benchmark-Werten basieren auf den von Reflection AI veröffentlichten Daten.