Arcee AI est une petite entreprise de seulement 26 personnes, mais ils viennent de faire quelque chose qui a surpris beaucoup de gens dans le secteur : ils ont dépensé environ la moitié de leur capital-risque, 20 millions de dollars, en utilisant 2048 GPU Nvidia B300 pendant 33 jours, pour entraîner un modèle de raisonnement open source avec 40 milliards de paramètres appelé Trinity-Large-Thinking.
Les performances du modèle en matière de tâches d'agent sont assez impressionnantes : il a obtenu la première place (88 points) sur le benchmark Tau2-Airline, la deuxième place (91,9 points) sur PinchBench (Claude Opus 4.6 d'Anthropic a obtenu 93,3 points) et 96,3 points sur AIME25 en raisonnement mathématique. Le tout sous licence open source Apache 2.0, permettant une utilisation commerciale, un téléchargement et une modification.
Ce n'est pas de la force brute, c'est l'utilisation maximale de l'architecture MoE
Trinity-Large-Thinking est un modèle de Mixture of Experts (MoE) avec un total de 40 milliards de paramètres, mais chaque inférence n'en active qu'environ 1,3 milliard — il utilise 256 experts, dont seulement 4 sont sélectionnés à chaque fois. Cela signifie que le modèle possède la "réserve de connaissances" d'un grand modèle, mais la vitesse d'inférence et la consommation de ressources se rapprochent de celles d'un petit modèle.
Les données d'entraînement sont de 17 billions de tokens, dont plus de 8 billions ont été générés synthétiquement. Cette proportion est déjà courante dans les modèles open source de haute qualité actuels.
Un point fort plus technique est l'algorithme SMEBU (Soft-clamped Momentum Expert Bias Updates) développé par eux, conçu spécifiquement pour résoudre le problème d'"effondrement des experts" dans l'entraînement MoE à grande échelle. L'ensemble du processus d'entraînement de 17 billions de tokens s'est déroulé "sans pic de perte" — ce qui est rare dans l'entraînement de grands modèles, car de nombreux modèles MoE subissent des explosions soudaines de perte en cours de route.
Points forts et lacunes
Honnêtement, Trinity-Large-Thinking ne surpasse pas complètement Claude Opus, mais il excelle dans des scénarios spécifiques.
| Benchmark | Trinity-Large-Thinking | Claude Opus 4.6 |
|---|---|---|
| Tau2-Airline | 88 (1ère place) | Non publié |
| PinchBench | 91,9 (2e place) | 93,3 |
| AIME25 | 96,3 | — |
| GPQA-Diamond | 76,3 | 89,2 |
| MMLU-Pro | 83,4 | 89,1 |
Les performances en matière de tâches d'agent peuvent se rapprocher du niveau supérieur, mais en raisonnement général, il existe encore un écart d'environ 13 points de pourcentage. Cependant, compte tenu du fait qu'il s'agit d'un modèle open source et déployable localement, cet écart est déjà très faible.
De plus, ils ont également publié simultanément Trinity-Large-TrueBase — une version de "point de contrôle brut" qui conserve l'état de pré-entraînement pur avant le réglage fin par instructions. Cette version est très précieuse pour ceux qui font de la recherche fondamentale en IA, permettant d'étudier les impacts spécifiques du RLHF et du réglage fin par instructions sur le comportement du modèle.
Contexte plus large : La longue absence de l'IA open source américaine
Au cours de l'année écoulée, le classement des grands modèles open source a été principalement dominé par les entreprises chinoises : DeepSeek, Qwen, Kimi, GLM — tous les quelques mois, un nouveau modèle émergeait. Du côté américain, seul Llama de Meta était le seul pilier, mais Meta a récemment fermé certains nouveaux modèles, suscitant des critiques de la communauté open source. Arcee comble désormais ce vide.
Le PDG Mark McQuade a déclaré que l'objectif du modèle est les entreprises : il peut être déployé localement, personnalisé, et les données n'ont pas besoin d'être envoyées aux fournisseurs de services cloud. Pour les institutions financières, de santé et gouvernementales ayant des exigences de conformité des données, la caractéristique de "pouvoir fonctionner sur son propre serveur" est parfois plus utile que les scores de benchmark.
26 personnes, 20 millions de dollars, 33 jours, 40 milliards de paramètres.
L'histoire des petites entreprises qui réalisent de grandes choses n'est pas encore morte dans le monde de l'IA.
Sources de référence : Arcee AI spent half its venture capital to build an open reasoning model that rivals Claude Opus in agent tasks (The Decoder) ; Tiny startup Arcee AI built a 400B-parameter open source LLM from scratch to best Meta's Llama (TechCrunch) ; CocoLoop ; Arcee aims to reboot U.S. open source AI with new Trinity models released under Apache 2.0 (VentureBeat)