Reflection AI lanza Beam, su modelo abierto de 501.000 millones de parámetros

Reflection AI ha lanzado su primer modelo de pesos abiertos, Beam. Se trata de un modelo de mezcla de expertos (MoE) disperso con 501.000 millones de parámetros en total, de los cuales 23.000 millones se activan por token, orientado a tareas de programación, razonamiento y agentes. La empresa dice que los pesos, el informe técnico y la ficha del modelo se publicarán más adelante este mes bajo licencia Apache 2.0; el modelo todavía está en la última ronda de red teaming y evaluación, aunque los desarrolladores ya pueden solicitar acceso anticipado en platform.reflection.ai.

Reflection fue fundada por antiguos investigadores de DeepMind y pasó más de un año operando en modo sigiloso. En junio cerró con SpaceX un acuerdo de capacidad de cómputo por unos 6.300 millones de dólares en total, alrededor de 150 millones de dólares al mes.

Cómo se entrenó Beam

Según el blog oficial, Beam tiene 52 capas, y una fase intermedia de entrenamiento amplió su ventana de contexto a 1 millón de tokens. El preentrenamiento usó 23,8 billones de tokens, procedentes de la web pública y de conjuntos de datos con licencia; los tokens web en bruto pasaron por un filtrado por niveles que descartó alrededor del 95%.

En cuanto a cómputo, el preentrenamiento corrió en 6.144 GPU Nvidia GB300 durante algo menos de cuatro semanas. La fase posterior de aprendizaje por refuerzo (RL) pasó a 10.500 GB300 y se extendió otras cuatro semanas, generando más de 100 millones de rollouts y empleando alrededor de 1.300 millones de entornos sandbox. Reflection se muestra muy confiada sobre la escala de este entrenamiento de RL:

"We believe this is one of the largest scale RL runs conducted by any open lab to date."

Es decir, la empresa considera que ha llevado a cabo uno de los mayores entrenamientos de aprendizaje por refuerzo realizados hasta la fecha por un laboratorio abierto. El blog añade que, a medida que aumentaba el cómputo dedicado al RL, las capacidades del modelo seguían subiendo en todos los frentes, "sin señales de meseta".

Frente a los modelos abiertos chinos

Los modelos con los que Reflection compara a Beam son casi todos chinos, y la empresa lo deja bastante claro. En su tabla comparativa oficial, Beam queda a la par de GLM 5.2, de Zhipu AI, mientras afirma usar solo entre un cuarto y un tercio de la capacidad de cómputo de inferencia de su rival; en tareas de código y de agentes, dice acercarse a Qwen 3.8-Max, un modelo de más de 2 billones de parámetros.

Algunas cifras destacadas:

BenchmarkBeamComparación
SWE-bench Verified80,9Inkling 77,6
Terminal Bench v2.180,1DeepSeek V4.1 Flash 90,6
SWE Bench Pro v2-Hard77,2Kimi K3 88,2
BrowseComp (con contexto)77,4Kimi K3 91,2
GPQA Diamond90,5Kimi K3 93,5

En esta tabla, Beam gana en pocos apartados. En operaciones de terminal, ingeniería de software de alta dificultad y búsqueda web, Kimi K3 y DeepSeek V4.1 Flash llevan unos diez puntos de ventaja. El argumento de venta de Reflection es la eficiencia: con 23.000 millones de parámetros activados, una cifra pequeña para este nivel de puntuación, el coste de despliegue debería ser notablemente menor.

En la prensa internacional, el relato dominante es el de "la primera startup estadounidense capaz de plantar cara directamente a los principales modelos abiertos chinos". Desde hace más de un año, la cabeza de la clasificación de modelos de pesos abiertos la ocupan DeepSeek, Qwen, Kimi y GLM; del lado estadounidense, Meta desplazó su foco hacia su línea cerrada Muse, dejando pocos modelos abiertos de gran tamaño en la carrera. Beam llega a llenar ese hueco.

Lo que todavía queda por responder

Todas las cifras mencionadas arriba proceden de las evaluaciones internas de la propia Reflection; los detalles sobre la configuración de las pruebas y el número de muestreos tendrán que esperar al informe técnico. Los pesos aún no se han publicado, así que la comunidad no puede verificar los resultados de forma independiente.

El blog no ofrece ninguna tabla de precios de API ni especifica en qué plataformas de inferencia se lanzará primero el modelo, y solo menciona futuros "socios de distribución del ecosistema". La licencia Apache 2.0 permitirá, una vez publicados los pesos, uso comercial libre y ajuste fino (fine-tuning), pero los 501.000 millones de parámetros completos exigen bastante memoria de GPU, por lo que la mayoría de los equipos probablemente tendrán que esperar versiones cuantizadas o alojamiento de terceros.

Fuentes: blog oficial de Reflection AI, Latent Space, CocoLoop, SiliconANGLE; las cifras de parámetros, cómputo de entrenamiento y benchmarks se basan en los datos publicados oficialmente por Reflection AI.