Arcee AI es una pequeña empresa de solo 26 personas, pero acaban de hacer algo que sorprendió a muchos en el sector: gastaron aproximadamente la mitad de su capital de riesgo, 20 millones de dólares, utilizando 2048 GPU Nvidia B300 durante 33 días, para entrenar un modelo de razonamiento de código abierto con 40 mil millones de parámetros llamado Trinity-Large-Thinking.
El rendimiento del modelo en tareas de agente es bastante impresionante: obtuvo el primer lugar (88 puntos) en el benchmark Tau2-Airline, el segundo lugar (91,9 puntos) en PinchBench (Claude Opus 4.6 de Anthropic obtuvo 93,3 puntos) y 96,3 puntos en AIME25 de razonamiento matemático. Todo bajo la licencia de código abierto Apache 2.0, permitiendo uso comercial, descarga y modificación.
No es fuerza bruta, es el uso máximo de la arquitectura MoE
Trinity-Large-Thinking es un modelo de Mezcla de Expertos (MoE) con un total de 40 mil millones de parámetros, pero cada inferencia solo activa aproximadamente 1,3 mil millones — utiliza 256 expertos, de los cuales solo se seleccionan 4 cada vez. Esto significa que el modelo tiene la "reserva de conocimiento" de un modelo grande, pero la velocidad de inferencia y el consumo de recursos se acercan a los de un modelo pequeño.
Los datos de entrenamiento son 17 billones de tokens, de los cuales más de 8 billones se generaron sintéticamente. Esta proporción ya es común en los modelos de código abierto de alta calidad actuales.
Un punto destacado más técnico es el algoritmo SMEBU (Soft-clamped Momentum Expert Bias Updates) desarrollado por ellos, diseñado específicamente para resolver el problema de "colapso de expertos" en el entrenamiento de MoE a gran escala. Todo el proceso de entrenamiento de 17 billones de tokens ocurrió "sin picos de pérdida" — algo raro en el entrenamiento de modelos grandes, ya que muchos modelos MoE sufren explosiones repentinas de pérdida a mitad del proceso.
Fortalezas y debilidades
Sinceramente, Trinity-Large-Thinking no supera completamente a Claude Opus, pero destaca en escenarios específicos.
| Benchmark | Trinity-Large-Thinking | Claude Opus 4.6 |
|---|---|---|
| Tau2-Airline | 88 (1.er lugar) | No publicado |
| PinchBench | 91,9 (2.º lugar) | 93,3 |
| AIME25 | 96,3 | — |
| GPQA-Diamond | 76,3 | 89,2 |
| MMLU-Pro | 83,4 | 89,1 |
El rendimiento en tareas de agente puede acercarse al nivel superior, pero en razonamiento general todavía hay una brecha de aproximadamente 13 puntos porcentuales. Sin embargo, considerando que este es un modelo de código abierto y se puede implementar localmente, esta brecha ya es muy pequeña.
Además, también lanzaron simultáneamente Trinity-Large-TrueBase — una versión de "punto de control bruto" que conserva el estado de preentrenamiento puro antes del ajuste fino por instrucciones. Esta versión es muy valiosa para quienes realizan investigación básica en IA, permitiendo estudiar los impactos específicos de RLHF y el ajuste fino por instrucciones en el comportamiento del modelo.
Contexto más amplio: La larga ausencia de IA de código abierto en EE. UU.
En el último año, el ranking de modelos grandes de código abierto fue dominado principalmente por empresas chinas: DeepSeek, Qwen, Kimi, GLM — cada pocos meses surgía un nuevo modelo. Del lado estadounidense, solo Llama de Meta era el único pilar, pero Meta recientemente cerró algunos modelos nuevos, generando críticas de la comunidad de código abierto. Arcee llena este vacío ahora.
El CEO Mark McQuade dijo que el objetivo del modelo son las empresas: puede implementarse localmente, personalizarse y los datos no necesitan enviarse a proveedores de servicios en la nube. Para instituciones financieras, de salud y gubernamentales con requisitos de cumplimiento de datos, la característica de "poder ejecutarse en su propio servidor" a veces es más útil que las puntuaciones de benchmark.
26 personas, 20 millones de dólares, 33 días, 40 mil millones de parámetros.
La historia de pequeñas empresas haciendo grandes cosas aún no ha muerto en el mundo de la IA.
Fuentes de referencia: Arcee AI spent half its venture capital to build an open reasoning model that rivals Claude Opus in agent tasks (The Decoder); Tiny startup Arcee AI built a 400B-parameter open source LLM from scratch to best Meta's Llama (TechCrunch); CocoLoop; Arcee aims to reboot U.S. open source AI with new Trinity models released under Apache 2.0 (VentureBeat)