A Poolside não apresentou um modelo de um trilhão de parâmetros. O Laguna S 2.1 chega como um modelo MoE para programação com 118B de parâmetros totais e 8B de parâmetros ativos. Os pesos estão no Hugging Face, e a empresa afirma que ele pode rodar em uma única NVIDIA DGX Spark.
O ponto central é que uma empresa ocidental colocou no mercado um modelo de código com pesos abertos e possibilidade de auto-hospedagem. A Poolside não diz que superou GPT ou Claude. Nos números oficiais, o Laguna S 2.1 marca 70,2% no Terminal-Bench 2.1, ainda atrás da fronteira fechada. A aposta é que empresas aceitem essa diferença se código, logs e dados ficarem dentro da própria infraestrutura.
Primeiro, um tamanho que dá para implantar
Segundo o blog oficial, o Laguna S 2.1 é um Mixture-of-Experts com 118B-total e 8B-active, suporte a até 1 milhão de tokens de contexto e menos de nove semanas entre o início do treinamento e o lançamento.
O foco é agentic coding. A Poolside lista 70,2% no Terminal-Bench 2.1, 78,5% no SWE-Bench Multilingual, 59,4% no conjunto público SWE-Bench Pro e 40,4% no DeepSWE. O The Next Web chegou a uma leitura parecida: o modelo se aproxima ou passa vários modelos abertos maiores no Terminal-Bench e no SWE-Bench Pro, enquanto modelos fechados ainda lideram por cerca de 10 a 15 pontos.
Esses números não devem ser lidos como uma comparação perfeita. O 70,2% vem do agent harness da própria Poolside no Terminal-Bench 2.1. O 40,4% do DeepSWE usa thinking mode; no mesmo critério, o modo no-thinking fica em 16,5%. A empresa também observa que parte das comparações usa valores reportados por fornecedores, rankings ou melhores resultados de terceiros. Servem mais para posicionamento do que para um confronto exato.
A citação fala de hábitos de trabalho
A Poolside não apresenta a atualização como simples aumento de parâmetros. Ela enfatiza mais verificação, menos suposições, menos declarações prematuras de vitória e mais persistência.
"What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent."
Pengming Wang, co-líder de pesquisa aplicada da Poolside, descreve uma disciplina de engenharia: conferir mais, assumir menos e não encerrar antes de os testes realmente passarem.
Os exemplos divulgados seguem essa linha. A Poolside diz que o Laguna S 2.1 criou um motor simples de renderização HTML/CSS a partir de uma pasta vazia em uma sessão de 50 minutos e 181 passos. Em outra tarefa interna de otimização de harness, aumentou a velocidade em 5,2% e reduziu alocações de memória em cerca de 70%. Não é prova de desempenho em clientes, mas mostra a venda de trabalho longo de engenharia com autoverificação.
Uma brecha para pesos abertos
No último ano, grande parte do ruído em modelos abertos de programação veio de equipes chinesas como Kimi K3, Qwen, DeepSeek e MiniMax. No Ocidente, muitos fornecedores continuaram vendendo APIs fechadas, enquanto modelos abertos nem sempre chamaram atenção por escala ou capacidade de código.
O desenho 118B-A8B do Laguna S 2.1 parece um compromisso: mais apto a tarefas longas que modelos de 30B, mas mais prático que sistemas trilionários. O model card do Hugging Face confirma que a versão NVFP4 usa a licença OpenMDW-1.1. O vLLM Recipes alerta que os pesos BF16 têm cerca de 235GB; versões quantizadas são o caminho mais realista para desktops e nós multi-GPU.
Para empresas reguladas, isso pesa. Código, vulnerabilidades, dados de clientes e logs internos nem sempre podem ir para uma API fechada no exterior. Rodar localmente, auditar pesos e licença e conectar a vLLM, SGLang, Ollama, OpenRouter e Vercel AI Gateway pode importar mais do que alguns pontos em benchmark.
O custo aparece nas limitações
A Poolside também lista fragilidades. Em agent harnesses de terceiros, o modelo pode memorizar demais os formatos de ferramenta da própria Poolside e usar errado schemas parecidos. Chamadas de ferramenta aninhadas podem gerar JSON com escaping incorreto. O thinking mode às vezes pensa por tempo demais, especialmente em problemas de matemática competitiva.
As três limitações apontam para o mesmo risco: agentes de código não falham apenas por não saber escrever código. Protocolos de ferramenta, orçamento de contexto e momento de parar podem ser mais críticos. Depois que o modelo é ligado a CI, repositórios, tickets e permissões, uma chamada de ferramenta errada pode custar mais que uma resposta errada.
A Poolside também deu uma referência de preço. O endpoint gratuito da OpenRouter oferece 256K de contexto; o endpoint pago dedicado oferece o 1M completo por US$ 0,10 por milhão de tokens de entrada, US$ 0,20 por milhão de tokens de saída e US$ 0,01 por milhão de tokens de leitura em cache. É bem mais barato que modelos fechados de fronteira, mas sessões longas de agente podem consumir centenas de milhares de tokens de saída.
A validação virá nos repositórios
A posição industrial do Laguna S 2.1 é clara: não é uma tentativa de liderar todos os rankings contra modelos fechados, mas uma base de agente de programação que empresas ocidentais podem baixar, hospedar e encaixar em stacks de inferência existentes.
Os próximos sinais são práticos: downloads e reproduções no Hugging Face, estabilidade de vLLM, Ollama e SGLang em repositórios reais, a capacidade da próxima geração Laguna de reduzir a diferença no Terminal-Bench e a aceitação da licença OpenMDW em análises comerciais de conformidade.
Se esses pontos funcionarem, o valor do Laguna S 2.1 não está no rótulo de “DeepSeek ocidental”. A resposta é mais concreta: código fica local, o modelo consegue trabalhar por muito tempo no repositório, a conta é previsível e a diferença de capacidade já é pequena o bastante para testes em projetos reais.
Fontes: blog oficial da Poolside, model card do Hugging Face, vLLM Recipes, CocoLoop, The Next Web; verificados parâmetros do modelo, parâmetros ativos, janela de contexto, critérios de benchmark, hardware de treinamento, licença, implantação de inferência e limitações publicadas.