Reflection AI a publié son premier modèle à poids ouverts, Beam. Il s'agit d'un modèle à mélange d'experts (MoE) épars totalisant 501 milliards de paramètres, dont 23 milliards activés par token, pensé pour le code, le raisonnement et les tâches d'agent. L'entreprise annonce que les poids, le rapport technique et la fiche du modèle seront publiés plus tard ce mois-ci sous licence Apache 2.0 ; le modèle est encore en phase finale de red teaming et d'évaluation, mais les développeurs peuvent déjà demander un accès anticipé sur platform.reflection.ai.
Reflection AI a été fondée par d'anciens chercheurs de DeepMind et a passé plus d'un an en mode furtif avant cette annonce. En juin, l'entreprise a signé avec SpaceX un contrat de calcul d'environ 6,3 milliards de dollars au total, soit près de 150 millions de dollars par mois.
Comment Beam a été entraîné
Selon le blog officiel, Beam compte 52 couches, et une phase d'entraînement intermédiaire a étendu sa fenêtre de contexte à 1 million de tokens. Le pré-entraînement a mobilisé 23,8 billions de tokens, issus du web public et de jeux de données sous licence ; les tokens web bruts ont subi un filtrage par niveaux de qualité qui en a écarté environ 95 %.
Côté calcul, le pré-entraînement a tourné sur 6 144 GPU Nvidia GB300 pendant un peu moins de quatre semaines. La phase d'apprentissage par renforcement qui a suivi est passée à 10 500 GB300, pour quatre semaines supplémentaires, générant plus de 100 millions de rollouts et mobilisant environ 1,3 milliard d'environnements sandbox. Reflection affiche une grande confiance dans l'ampleur de cette phase de RL :
"We believe this is one of the largest scale RL runs conducted by any open lab to date."
Autrement dit, l'entreprise estime avoir mené l'un des plus grands entraînements par renforcement jamais réalisés par un laboratoire ouvert. Le blog ajoute qu'en augmentant la puissance de calcul allouée au RL, les performances du modèle continuent de progresser sur tous les fronts, sans « signe de plateau ».
Face aux modèles ouverts chinois
Les modèles auxquels Reflection compare Beam sont presque tous chinois, et l'entreprise ne s'en cache pas. Dans son tableau comparatif officiel, Beam se mesure à GLM 5.2 de Zhipu AI avec des résultats serrés, tout en affirmant n'utiliser qu'un quart à un tiers de la puissance de calcul d'inférence de son rival ; sur le code et les tâches d'agent, elle dit approcher Qwen 3.8-Max, un modèle de plus de 2 000 milliards de paramètres.
Quelques chiffres à retenir :
| Benchmark | Beam | Comparaison |
|---|---|---|
| SWE-bench Verified | 80,9 | Inkling 77,6 |
| Terminal Bench v2.1 | 80,1 | DeepSeek V4.1 Flash 90,6 |
| SWE Bench Pro v2-Hard | 77,2 | Kimi K3 88,2 |
| BrowseComp (avec contexte) | 77,4 | Kimi K3 91,2 |
| GPQA Diamond | 90,5 | Kimi K3 93,5 |
Dans ce tableau, Beam ne l'emporte que sur peu de critères. Sur les opérations en terminal, l'ingénierie logicielle de haut niveau et la recherche web, Kimi K3 et DeepSeek V4.1 Flash gardent une dizaine de points d'avance. L'argument de vente de Reflection, c'est l'efficacité : avec seulement 23 milliards de paramètres activés, un chiffre modeste pour ce niveau de score, le coût de déploiement s'annonce nettement plus bas.
Dans la presse occidentale, le récit dominant est celui d'une « première startup américaine capable de rivaliser frontalement avec les meilleurs modèles ouverts chinois ». Depuis plus d'un an, le haut du classement des modèles à poids ouverts est occupé par DeepSeek, Qwen, Kimi et GLM ; du côté américain, Meta a réorienté ses efforts vers sa gamme fermée Muse, laissant peu de grands modèles ouverts dans la course. Beam vient combler ce vide.
Ce qui reste en suspens
Tous les scores cités ci-dessus proviennent des évaluations internes de Reflection ; les détails du protocole de test et du nombre d'échantillons devront attendre le rapport technique. Les poids n'ont pas encore été publiés, donc la communauté ne peut pas encore vérifier ces résultats de façon indépendante.
Le blog ne donne aucune grille tarifaire pour une éventuelle API et ne précise pas sur quelles plateformes d'inférence le modèle sera disponible en premier, évoquant seulement des « partenaires de distribution » à venir. La licence Apache 2.0 permettra, une fois les poids publiés, un usage commercial et un fine-tuning libres, mais les besoins en mémoire GPU pour faire tourner l'intégralité des 501 milliards de paramètres resteront élevés : la plupart des équipes devront probablement attendre des versions quantifiées ou un hébergement tiers.
Sources : blog officiel de Reflection AI, Latent Space, CocoLoop, SiliconANGLE ; les chiffres de paramètres, de calcul d'entraînement et de benchmarks proviennent des données publiées par Reflection AI.