Reflection AI lança Beam, modelo aberto com 501 bilhões de parâmetros

A Reflection AI lançou seu primeiro modelo de pesos abertos, o Beam. Trata-se de um modelo de mistura de especialistas (MoE) esparso, com 501 bilhões de parâmetros no total e 23 bilhões ativados por token, voltado a tarefas de programação, raciocínio e agentes. A empresa afirma que os pesos, o relatório técnico e o model card serão divulgados ainda este mês sob licença Apache 2.0; o modelo ainda está passando pela rodada final de red teaming e avaliação, mas desenvolvedores já podem solicitar acesso antecipado em platform.reflection.ai.

A Reflection foi fundada por ex-pesquisadores do DeepMind e passou mais de um ano operando em modo stealth. Em junho, a empresa fechou com a SpaceX um contrato de capacidade computacional de cerca de 6,3 bilhões de dólares no total, o equivalente a aproximadamente 150 milhões de dólares por mês.

Como o Beam foi treinado

Segundo o blog oficial, o Beam tem 52 camadas, e uma fase intermediária de treinamento ampliou sua janela de contexto para 1 milhão de tokens. O pré-treinamento usou 23,8 trilhões de tokens, vindos de páginas públicas da web e conjuntos de dados licenciados; os tokens brutos da web passaram por um filtro em camadas que descartou cerca de 95% do material.

Em termos de capacidade computacional, o pré-treinamento rodou em 6.144 GPUs Nvidia GB300 por pouco menos de quatro semanas. A fase de aprendizado por reforço (RL) que se seguiu passou a usar 10.500 GB300, por mais quatro semanas, gerando mais de 100 milhões de rollouts e usando cerca de 1,3 bilhão de ambientes sandbox. A Reflection se mostra bastante confiante sobre a escala desse treinamento de RL:

"We believe this is one of the largest scale RL runs conducted by any open lab to date."

Em outras palavras, a empresa acredita ter conduzido um dos maiores treinamentos de aprendizado por reforço já feitos por um laboratório aberto até hoje. O blog também menciona que, à medida que a capacidade computacional de RL aumentava, as habilidades do modelo continuavam subindo em todas as frentes, "sem sinal de platô".

Comparado aos modelos abertos chineses

Os modelos usados como referência pela Reflection são quase todos chineses, e a empresa não esconde isso. Na tabela comparativa oficial, o Beam fica bem próximo do GLM 5.2, da Zhipu AI, enquanto afirma usar apenas um quarto a um terço da capacidade computacional de inferência do rival; em tarefas de código e de agentes, diz se aproximar do Qwen 3.8-Max, um modelo com mais de 2 trilhões de parâmetros.

Alguns números para destacar:

BenchmarkBeamComparação
SWE-bench Verified80,9Inkling 77,6
Terminal Bench v2.180,1DeepSeek V4.1 Flash 90,6
SWE Bench Pro v2-Hard77,2Kimi K3 88,2
BrowseComp (com contexto)77,4Kimi K3 91,2
GPQA Diamond90,5Kimi K3 93,5

Nessa tabela, o Beam vence em poucos quesitos. Em operações de terminal, engenharia de software de alta dificuldade e busca na web, Kimi K3 e DeepSeek V4.1 Flash ficam cerca de dez pontos na frente. O principal argumento de venda da Reflection é a eficiência: com 23 bilhões de parâmetros ativados, um número pequeno para essa faixa de pontuação, o custo de implantação deve ser bem menor.

A narrativa na imprensa internacional costuma ser a de "a primeira startup americana a lançar um modelo capaz de rivalizar diretamente com os principais modelos abertos chineses". Há mais de um ano, o topo dos rankings de modelos de pesos abertos é ocupado por DeepSeek, Qwen, Kimi e GLM; do lado americano, a Meta deslocou seu foco para a linha fechada Muse, deixando poucos modelos abertos de grande porte no páreo. O Beam chega para preencher essa lacuna.

O que ainda falta responder

Todos os números citados acima vêm das avaliações internas da própria Reflection; detalhes sobre a configuração dos testes e o número de amostragens só devem ser esclarecidos no relatório técnico. Os pesos ainda não foram divulgados, então a comunidade não tem como verificar os resultados de forma independente.

O blog não traz nenhuma tabela de preços de API, nem informa em quais plataformas de inferência o modelo será lançado primeiro, mencionando apenas futuras parcerias de "distribuição no ecossistema". A licença Apache 2.0 permitirá, uma vez que os pesos sejam liberados, uso comercial livre e fine-tuning, mas os 501 bilhões de parâmetros completos exigem bastante memória de GPU — a maioria das equipes provavelmente vai esperar por versões quantizadas ou por hospedagem de terceiros.

Fontes: blog oficial da Reflection AI, Latent Space, CocoLoop, SiliconANGLE; os números de parâmetros, capacidade computacional de treinamento e benchmarks seguem os dados divulgados oficialmente pela Reflection AI.