Poolside n'a pas sorti un modèle à milliers de milliards de paramètres. Laguna S 2.1 est un modèle MoE de code avec 118B paramètres au total et 8B actifs, des poids sur Hugging Face et une trajectoire de déploiement qui descend jusqu'à une NVIDIA DGX Spark.
Le sujet n'est pas une victoire sur GPT ou Claude. Une entreprise occidentale propose enfin un modèle de code open-weight auto-hébergeable, mais son score Terminal-Bench 2.1 est de 70,2%, encore derrière les meilleurs modèles fermés.
Une taille exploitable
Poolside indique que Laguna S 2.1 accepte jusqu'à 1M tokens de contexte et a été lancé moins de neuf semaines après le début de l'entraînement. Les chiffres annoncés incluent 70,2% sur Terminal-Bench 2.1, 78,5% sur SWE-Bench Multilingual, 59,4% sur SWE-Bench Pro public dataset et 40,4% sur DeepSWE.
Ces chiffres demandent du contexte. Le 70,2% vient du harness d'agent de Poolside. Le 40,4% DeepSWE concerne le mode thinking. Certaines comparaisons utilisent des scores maximums de fournisseurs, de classements ou de tiers.
La citation parle de méthode
What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent.
Le message de Pengming Wang est clair: le progrès porte sur la vérification, la persistance et le refus de conclure trop tôt.
Poolside cite une session de 50 minutes et 181 étapes pour créer un moteur de rendu HTML/CSS simple, ainsi qu'une optimisation interne de harness avec 5,2% de vitesse en plus et environ 70% d'allocation mémoire en moins.
Le vide open-weight
La dynamique récente des modèles de code open-weight venait surtout de Kimi, Qwen, DeepSeek et MiniMax. Laguna S 2.1 choisit un milieu: plus solide pour les longues tâches que les modèles 30B, plus exploitable que les systèmes à milliers de milliards de paramètres.
La carte Hugging Face confirme la licence OpenMDW-1.1 pour la variante NVFP4. vLLM Recipes note que les poids BF16 font environ 235GB, ce qui rend les checkpoints quantifiés plus réalistes pour de nombreux environnements.
Les limites comptent
Poolside liste des limites précises: suradaptation au format de ses propres outils dans des harness tiers, JSON invalide dans des tool calls imbriqués et mode thinking parfois trop long.
OpenRouter propose un endpoint gratuit 256K et un endpoint dédié 1M contexte à ,10 input, ,20 output et ,01 cache-read par million de tokens. C'est peu cher, mais un agent long peut consommer énormément de tokens de sortie.
La preuve sera dans les dépôts
Les prochains signaux seront les reproductions sur Hugging Face, la stabilité de vLLM/Ollama/SGLang, les performances sur de vrais dépôts et la capacité du prochain Laguna à réduire l'écart Terminal-Bench.
Laguna S 2.1 n'est pas un tueur de modèles fermés. C'est une option lisible pour les achats: garder le code en local, lancer de longs jobs de code, comprendre la licence et les coûts, puis tester si l'écart de capacité est acceptable.
Sources: blog officiel Poolside, model card Hugging Face, vLLM Recipes, CocoLoop, The Next Web; vérification de la taille du modèle, des paramètres actifs, de la fenêtre de contexte, du périmètre des benchmarks, du matériel d'entraînement, de la licence, des chemins de déploiement et des limites publiées.