Poolside no presentó un gigante de billones de parámetros. Laguna S 2.1 es un modelo MoE de código con 118B parámetros totales y 8B activos, pesos en Hugging Face y una ruta de despliegue que llega hasta una NVIDIA DGX Spark.
La noticia no es que venza a GPT o Claude. Una compañía occidental ofrece por fin un modelo de código open-weight y autoalojable, pero su propio resultado en Terminal-Bench 2.1 es 70,2%, todavía por detrás de la frontera cerrada.
Un tamaño que se puede desplegar
Poolside dice que Laguna S 2.1 admite hasta 1M tokens de contexto y pasó del inicio del entrenamiento al lanzamiento en menos de nueve semanas. Sus cifras incluyen 70,2% en Terminal-Bench 2.1, 78,5% en SWE-Bench Multilingual, 59,4% en SWE-Bench Pro public dataset y 40,4% en DeepSWE.
Hay que leerlas con cuidado. El 70,2% viene del agent harness de Poolside. El 40,4% de DeepSWE corresponde al modo thinking. Algunas comparaciones usan máximos de proveedores, rankings o terceros.
La cita habla de hábitos de trabajo
What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent.
La idea de Pengming Wang es directa: el modelo verifica más, asume menos y no marca una tarea como terminada demasiado pronto.
Poolside muestra dos ejemplos: una sesión de 50 minutos y 181 pasos para crear un renderizador HTML/CSS simple, y una optimización interna del harness con 5,2% más velocidad y cerca de 70% menos asignación de memoria.
El hueco open-weight
El impulso reciente en modelos de código open-weight vino de Kimi, Qwen, DeepSeek y MiniMax. Laguna S 2.1 ocupa una zona media: más fuerte para tareas largas que la clase 30B, más manejable que los modelos de billones de parámetros.
La tarjeta de Hugging Face confirma licencia OpenMDW-1.1 para la variante NVFP4. vLLM Recipes señala que los pesos BF16 rondan los 235GB, así que los checkpoints cuantizados son la vía práctica para muchos entornos.
Las limitaciones cuentan
Poolside enumera límites concretos: sobreajuste al formato de sus herramientas en harnesses de terceros, JSON inválido en llamadas de herramienta anidadas y thinking mode que puede durar más de lo previsto.
OpenRouter ofrece un endpoint gratuito de 256K y uno dedicado de 1M contexto a ,10 input, ,20 output y ,01 cache-read por millón de tokens. Es barato, pero un agente largo puede gastar cientos de miles de tokens de salida.
La prueba está en los repositorios
Lo siguiente a vigilar es la reproducción en Hugging Face, la estabilidad de vLLM/Ollama/SGLang, el rendimiento en repositorios reales y si el próximo Laguna reduce la distancia en Terminal-Bench.
Laguna S 2.1 no es un destructor de modelos cerrados. Es una opción comprensible para compras: código local, trabajos largos, licencia clara, costes calculables y una brecha de capacidad suficientemente pequeña para pruebas reales.
Fuentes: blog oficial de Poolside, model card de Hugging Face, vLLM Recipes, CocoLoop, The Next Web; se verificaron tamaño del modelo, parámetros activos, ventana de contexto, alcance de benchmark, hardware de entrenamiento, licencia, rutas de despliegue y limitaciones publicadas.