Poolside no intentó llamar la atención con un modelo de un billón de parámetros. Laguna S 2.1 es un modelo MoE para programación con 118B parámetros totales y 8B parámetros activos. Los pesos están disponibles en Hugging Face, y la compañía dice que puede ejecutarse en una sola NVIDIA DGX Spark.
La noticia importa porque una empresa occidental ha publicado un modelo de código open-weight que puede alojarse en infraestructura propia. Poolside no afirma haber superado a GPT o Claude. En sus cifras oficiales, Laguna S 2.1 logra 70,2% en Terminal-Bench 2.1, todavía por detrás de la frontera cerrada. Su apuesta es que algunas empresas aceptarán esa distancia si el código, los registros y los datos permanecen en sus propias máquinas.
Primero, un tamaño desplegable
Poolside describe Laguna S 2.1 como un Mixture-of-Experts de 118B-total y 8B-active, con soporte para hasta 1 millón de tokens de contexto, y menos de nueve semanas entre el inicio del entrenamiento y el lanzamiento.
El modelo está pensado para agentic coding. Poolside lista 70,2% en Terminal-Bench 2.1, 78,5% en SWE-Bench Multilingual, 59,4% en el conjunto público SWE-Bench Pro y 40,4% en DeepSWE. The Next Web ofrece una lectura similar: se acerca o supera a varios modelos abiertos más grandes en Terminal-Bench y SWE-Bench Pro, mientras que los modelos cerrados aún lideran por unos 10 a 15 puntos.
Esas cifras no deben mezclarse como una clasificación única. El 70,2% sale del agent harness propio de Poolside para Terminal-Bench 2.1. El 40,4% de DeepSWE corresponde al thinking mode; con el mismo criterio, no-thinking queda en 16,5%. La compañía también reconoce que algunas comparaciones usan datos reportados por proveedores, rankings o máximos de terceros. Sirven mejor para ubicar el modelo que para una comparación exacta.
La cita habla de hábitos de trabajo
Poolside no presenta la mejora como simple aumento de parámetros. La empresa subraya más verificación, menos suposiciones, menos declaraciones prematuras de éxito y mayor persistencia.
"What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent."
Pengming Wang, codirector de investigación aplicada de Poolside, describe una disciplina de ingeniería: comprobar más, asumir menos y no cerrar la tarea antes de que las pruebas realmente pasen.
Los ejemplos publicados van en esa dirección. Poolside dice que Laguna S 2.1 construyó un motor simple de renderizado HTML/CSS desde una carpeta vacía en una sesión de 50 minutos y 181 pasos. En otra tarea interna de optimización de harness, mejoró la velocidad en 5,2% y redujo la asignación de memoria en torno a 70%. No prueban el rendimiento en clientes, pero muestran que Poolside quiere vender trabajo de ingeniería prolongado con autoverificación.
Una brecha para pesos abiertos
Durante el último año, gran parte del impulso en modelos de programación open-weight vino de equipos chinos como Kimi K3, Qwen, DeepSeek y MiniMax. En Occidente, muchos proveedores han preferido APIs cerradas, y los modelos abiertos no siempre han destacado por tamaño o capacidad de código.
El formato 118B-A8B de Laguna S 2.1 parece un punto medio: más capaz en tareas largas que un modelo de 30B, pero más fácil de llevar a producción que un sistema de un billón de parámetros. La ficha de Hugging Face confirma que la versión NVFP4 usa licencia OpenMDW-1.1. vLLM Recipes advierte que los pesos BF16 rondan los 235GB, por lo que las versiones cuantizadas son más realistas para escritorios y nodos multi-GPU.
Para empresas reguladas, esto es muy concreto. Código, vulnerabilidades, datos de clientes y registros internos no siempre pueden enviarse a una API cerrada en el extranjero. Ejecutar localmente, auditar pesos y licencia, y conectar con vLLM, SGLang, Ollama, OpenRouter o Vercel AI Gateway puede pesar más que unos puntos de benchmark.
El coste también aparece en las limitaciones
Poolside enumera límites claros. En agent harnesses de terceros, el modelo puede recordar demasiado los formatos de herramientas de Poolside y usar mal schemas parecidos. Las llamadas de herramientas anidadas pueden generar JSON con escaping erróneo. El thinking mode a veces piensa demasiado tiempo, sobre todo en problemas de matemáticas competitivas.
Los tres puntos apuntan al mismo riesgo: los agentes de código no fallan solo por no saber escribir código. Los protocolos de herramientas, el presupuesto de contexto y el momento de detenerse pueden ser igual de importantes. Una vez conectado a CI, repositorios, tickets y permisos, una llamada de herramienta equivocada puede ser más costosa que una respuesta equivocada.
Poolside también da una referencia de precios. El endpoint gratuito de OpenRouter ofrece 256K de contexto; el endpoint dedicado de pago ofrece el contexto completo de 1M por 0,10 dólares por millón de tokens de entrada, 0,20 dólares por millón de tokens de salida y 0,01 dólares por millón de tokens de lectura en caché. Es mucho más barato que los modelos cerrados de frontera, pero una sesión larga de agente puede consumir cientos de miles de tokens de salida.
La prueba estará en los repositorios
La posición de Laguna S 2.1 es clara: no busca encabezar el ranking general frente a modelos cerrados, sino servir como base descargable, autoalojable y conectable a stacks de inferencia ya existentes.
Las señales a vigilar son prácticas: si las descargas y reproducciones de Hugging Face se sostienen, si vLLM, Ollama y SGLang son estables en repositorios reales, si la próxima generación Laguna reduce la brecha en Terminal-Bench y si la licencia OpenMDW resulta cómoda para revisión comercial de cumplimiento.
Si esos puntos funcionan, el valor de Laguna S 2.1 no estará en llamarlo “DeepSeek occidental”. La propuesta es más simple: el código se queda local, el modelo puede trabajar durante sesiones largas en el repositorio, la factura se calcula con claridad y la brecha de capacidad ya es lo bastante pequeña para probarlo en proyectos reales.
Fuentes: blog oficial de Poolside, ficha del modelo en Hugging Face, vLLM Recipes, CocoLoop, The Next Web; se verificaron parámetros del modelo, parámetros activos, ventana de contexto, metodología de benchmarks, hardware de entrenamiento, licencia, despliegue de inferencia y limitaciones publicadas.