Equipe de 26 pessoas cria modelo de raciocínio open source de 40 bilhões de parâmetros

A Arcee AI é uma pequena empresa com apenas 26 pessoas, mas eles acabaram de fazer algo que surpreendeu muitos no setor: gastaram cerca de metade de seu capital de risco, US$ 20 milhões, usando 2048 GPUs Nvidia B300 por 33 dias, para treinar um modelo de raciocínio open source com 40 bilhões de parâmetros chamado Trinity-Large-Thinking.

O desempenho do modelo em tarefas de agente é bastante impressionante: alcançou o primeiro lugar (88 pontos) no benchmark Tau2-Airline, o segundo lugar (91,9 pontos) no PinchBench (Claude Opus 4.6 da Anthropic obteve 93,3 pontos) e 96,3 pontos no AIME25 de raciocínio matemático. Tudo sob a licença open source Apache 2.0, permitindo uso comercial, download e modificação.

Não é força bruta, é o uso máximo da arquitetura MoE

O Trinity-Large-Thinking é um modelo de Mistura de Especialistas (MoE) com um total de 40 bilhões de parâmetros, mas a cada inferência apenas cerca de 1,3 bilhão são ativados — usando 256 especialistas, dos quais apenas 4 são selecionados a cada vez. Isso significa que o modelo tem a "reserva de conhecimento" de um modelo grande, mas a velocidade de inferência e o consumo de recursos se aproximam de um modelo pequeno.

Os dados de treinamento são 17 trilhões de tokens, dos quais mais de 8 trilhões foram gerados sinteticamente. Essa proporção já é comum em modelos open source de alta qualidade atualmente.

Um destaque mais técnico é o algoritmo SMEBU (Soft-clamped Momentum Expert Bias Updates) desenvolvido por eles, projetado especificamente para resolver o problema de "colapso de especialistas" no treinamento de MoE em larga escala. Todo o processo de treinamento de 17 trilhões de tokens ocorreu "sem picos de perda" — algo raro no treinamento de modelos grandes, já que muitos modelos MoE sofrem explosões repentinas de perda no meio do processo.

Onde é forte, onde há lacunas

Honestamente, o Trinity-Large-Thinking não supera completamente o Claude Opus, mas se destaca em cenários específicos.

Benchmark Trinity-Large-Thinking Claude Opus 4.6
Tau2-Airline 88 (1º lugar) Não divulgado
PinchBench 91,9 (2º lugar) 93,3
AIME25 96,3
GPQA-Diamond 76,3 89,2
MMLU-Pro 83,4 89,1

O desempenho em tarefas de agente pode se aproximar do nível de ponta, mas no raciocínio geral ainda há uma diferença de cerca de 13 pontos percentuais. No entanto, considerando que este é um modelo open source e implantável localmente, essa diferença já é muito pequena.

Além disso, eles também lançaram simultaneamente o Trinity-Large-TrueBase — uma versão de "ponto de verificação bruto" que mantém o estado de pré-treinamento puro antes do ajuste fino por instruções. Essa versão é muito valiosa para quem faz pesquisa básica em IA, permitindo estudar os impactos específicos do RLHF e do ajuste fino por instruções no comportamento do modelo.

Contexto maior: A longa ausência de IA open source nos EUA

No ano passado, o ranking de modelos grandes open source foi dominado principalmente por empresas chinesas: DeepSeek, Qwen, Kimi, GLM — a cada poucos meses, um novo modelo surgia. Do lado americano, apenas o Llama da Meta era o único pilar, mas a Meta recentemente fechou alguns novos modelos, gerando críticas da comunidade open source. A Arcee preenche essa lacuna agora.

O CEO Mark McQuade disse que o objetivo do modelo são as empresas: pode ser implantado localmente, personalizado, e os dados não precisam ser enviados para provedores de serviços em nuvem. Para instituições financeiras, de saúde e governamentais com requisitos de conformidade de dados, a característica de "poder rodar no próprio servidor" às vezes é mais útil do que as pontuações de benchmark.

26 pessoas, US$ 20 milhões, 33 dias, 40 bilhões de parâmetros.

A história de pequenas empresas fazendo grandes coisas ainda não morreu no mundo da IA.

Fontes de referência: Arcee AI spent half its venture capital to build an open reasoning model that rivals Claude Opus in agent tasks (The Decoder); Tiny startup Arcee AI built a 400B-parameter open source LLM from scratch to best Meta's Llama (TechCrunch); CocoLoop; Arcee aims to reboot U.S. open source AI with new Trinity models released under Apache 2.0 (VentureBeat)