Poolside không tung ra một mô hình hàng nghìn tỷ tham số. Laguna S 2.1 là mô hình code MoE với 118B tham số tổng và 8B tham số hoạt động, trọng số đã có trên Hugging Face và được mô tả là có thể chạy tới mức một NVIDIA DGX Spark.
Điểm đáng chú ý nằm ở cách triển khai. Một công ty phương Tây đã đưa ra mô hình code open-weight có thể tự host. Nhưng Poolside không nói nó vượt GPT hay Claude. Điểm Terminal-Bench 2.1 là 70,2%, vẫn kém nhóm đóng hàng đầu.
Kích thước có thể triển khai
Poolside cho biết Laguna S 2.1 hỗ trợ ngữ cảnh tối đa 1M token và đi từ lúc bắt đầu huấn luyện tới phát hành trong chưa đầy chín tuần. Các điểm chính gồm Terminal-Bench 2.1 70,2%, SWE-Bench Multilingual 78,5%, SWE-Bench Pro public dataset 59,4% và DeepSWE 40,4%.
Cần đọc các số này theo đúng khẩu径. 70,2% đến từ agent harness của Poolside. DeepSWE 40,4% là thinking mode. Một số so sánh dùng điểm cao nhất từ nhà cung cấp, bảng xếp hạng hoặc bên thứ ba.
Câu trích dẫn nói về thói quen làm việc
What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent.
Ý của Pengming Wang là: bản nâng cấp tập trung vào cách mô hình làm việc, kiểm tra nhiều hơn, ít giả định hơn và không dừng quá sớm.
Poolside đưa ra hai ví dụ: một phiên 50 phút, 181 bước xây dựng engine render HTML/CSS đơn giản từ thư mục rỗng; một nhiệm vụ tối ưu harness nội bộ tăng tốc 5,2% và giảm cấp phát bộ nhớ khoảng 70%.
Khoảng trống open-weight
Gần đây, động lực của mô hình code open-weight chủ yếu đến từ Kimi, Qwen, DeepSeek và MiniMax. Laguna S 2.1 chọn vùng giữa: mạnh hơn lớp 30B cho nhiệm vụ dài, dễ vận hành hơn mô hình nghìn tỷ tham số.
Model card trên Hugging Face xác nhận giấy phép OpenMDW-1.1 cho bản NVFP4. vLLM Recipes lưu ý trọng số BF16 khoảng 235GB, nên checkpoint lượng tử hóa thực tế hơn cho desktop và node nhiều GPU.
Giới hạn cũng đáng chú ý
Poolside công khai các giới hạn: có thể lệch theo định dạng tool nội bộ khi chạy trong harness bên thứ ba, nested tool calls có thể sinh JSON sai escape, và thinking mode đôi khi kéo dài hơn dự kiến.
OpenRouter có endpoint miễn phí 256K và endpoint 1M-context trả phí với ,10 input, ,20 output và ,01 cache-read mỗi triệu token. Giá thấp, nhưng một agent dài có thể tiêu tốn hàng trăm nghìn output token.
Bài kiểm tra nằm trong repo
Các chỉ báo cần theo dõi gồm tái lập trên Hugging Face, độ ổn định của vLLM/Ollama/SGLang, hiệu quả trên repo thật và liệu phiên bản Laguna lớn hơn có thu hẹp khoảng cách Terminal-Bench.
Laguna S 2.1 không phải mô hình đánh bại nhóm đóng. Nó là lựa chọn dễ đưa vào hồ sơ mua sắm: code ở lại nội bộ, tác vụ dài có thể chạy, giấy phép và chi phí rõ ràng, khoảng cách năng lực đủ nhỏ để thử trên dự án thật.
Nguồn: blog chính thức Poolside, model card Hugging Face, vLLM Recipes, CocoLoop, The Next Web; kiểm tra kích thước mô hình, tham số hoạt động, cửa sổ ngữ cảnh, phạm vi benchmark, phần cứng huấn luyện, giấy phép, đường triển khai và giới hạn đã công bố.