Poolside abre modelo de código 118B

A Poolside não lançou um gigante de trilhões de parâmetros. O Laguna S 2.1 é um modelo MoE de código com 118B parâmetros totais e 8B ativos, pesos no Hugging Face e uma promessa de execução até em um NVIDIA DGX Spark.

O ponto não é derrotar GPT ou Claude. Uma empresa ocidental agora oferece um modelo de código open-weight e self-hosted, mas seu próprio resultado no Terminal-Bench 2.1 é 70,2%, ainda atrás da fronteira fechada.

Tamanho que dá para operar

A Poolside diz que o Laguna S 2.1 suporta contexto de até 1M tokens e foi do início do treinamento ao lançamento em menos de nove semanas. Os números incluem 70,2% no Terminal-Bench 2.1, 78,5% no SWE-Bench Multilingual, 59,4% no SWE-Bench Pro public dataset e 40,4% no DeepSWE.

Esses números exigem cuidado. O 70,2% vem do agent harness da Poolside. O 40,4% do DeepSWE é no modo thinking. Algumas comparações usam máximos de fornecedores, rankings ou terceiros.

A citação fala de hábito de trabalho

What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent.

A leitura de Pengming Wang é simples: o ganho está em verificar mais, assumir menos e não declarar tarefa concluída cedo demais.

A Poolside cita uma sessão de 50 minutos e 181 passos criando um renderizador HTML/CSS simples e outra tarefa interna que elevou a velocidade do harness em 5,2% e reduziu alocação de memória em cerca de 70%.

A lacuna open-weight

O impulso recente em modelos de código open-weight veio de Kimi, Qwen, DeepSeek e MiniMax. O Laguna S 2.1 fica no meio: mais capaz para tarefas longas do que modelos de 30B, mais operável do que sistemas trilionários.

O model card do Hugging Face confirma a licença OpenMDW-1.1 para a variante NVFP4. O vLLM Recipes observa que os pesos BF16 têm cerca de 235GB, então checkpoints quantizados são a rota prática para muitos ambientes.

As limitações importam

A Poolside lista limitações concretas: overfitting ao formato de ferramentas próprias em harnesses de terceiros, JSON inválido em chamadas de ferramenta aninhadas e thinking mode que pode durar mais do que o esperado.

O OpenRouter oferece um endpoint gratuito de 256K e um endpoint dedicado de 1M contexto por ,10 input, ,20 output e ,01 cache-read por milhão de tokens. É barato, mas agentes longos podem consumir centenas de milhares de tokens de saída.

A prova está nos repositórios

Os próximos sinais são reprodução no Hugging Face, estabilidade em vLLM/Ollama/SGLang, desempenho em repositórios reais e se o próximo Laguna reduz a distância no Terminal-Bench.

O Laguna S 2.1 não é um assassino de modelos fechados. É uma opção compreensível para compras: código local, jobs longos, licença legível, custos calculáveis e uma diferença de capacidade pequena o suficiente para testes reais.

Fontes: blog oficial da Poolside, model card do Hugging Face, vLLM Recipes, CocoLoop, The Next Web; verificados tamanho do modelo, parâmetros ativos, janela de contexto, escopo de benchmark, hardware de treinamento, licença, rotas de deploy e limitações publicadas.