Poolside không đưa ra một mô hình nghìn tỷ tham số để gây chú ý. Laguna S 2.1 là mô hình MoE cho lập trình với 118B tham số tổng và 8B tham số hoạt động. Trọng số đã được đưa lên Hugging Face, và công ty nói mô hình có thể chạy trên một NVIDIA DGX Spark.
Điểm đáng chú ý là một công ty phương Tây đã phát hành mô hình lập trình open-weight có thể tự host. Poolside không tuyên bố vượt GPT hay Claude. Theo số liệu chính thức, Laguna S 2.1 đạt 70,2% trên Terminal-Bench 2.1, vẫn còn cách nhóm mô hình đóng tiên tiến. Lập luận của Poolside là doanh nghiệp có thể chấp nhận khoảng cách đó nếu mã nguồn, log và dữ liệu vẫn nằm trên máy của họ.
Ưu tiên kích thước có thể triển khai
Poolside mô tả Laguna S 2.1 là mô hình Mixture-of-Experts 118B-total, 8B-active, hỗ trợ tối đa 1 triệu token ngữ cảnh, và được phát hành chưa đầy 9 tuần sau khi bắt đầu huấn luyện.
Mô hình hướng tới agentic coding. Các điểm số được công bố gồm Terminal-Bench 2.1 70,2%, SWE-Bench Multilingual 78,5%, bộ công khai SWE-Bench Pro 59,4%, và DeepSWE 40,4%. The Next Web cũng đánh giá nó tiệm cận hoặc vượt một số mô hình mở lớn hơn trên Terminal-Bench và SWE-Bench Pro, trong khi mô hình đóng vẫn dẫn khoảng 10 đến 15 điểm phần trăm.
Không nên trộn các con số này thành một bảng xếp hạng tuyệt đối. Mức 70,2% đến từ agent harness của chính Poolside cho Terminal-Bench 2.1. Mức 40,4% của DeepSWE là thinking mode; cùng tiêu chí đó, no-thinking chỉ đạt 16,5%. Poolside cũng thừa nhận một số so sánh dùng số tự báo cáo của nhà cung cấp, leaderboard hoặc điểm cao nhất từ bên thứ ba, nên phù hợp để nhìn vị trí hơn là đối chiếu chính xác.
Trọng tâm là thói quen làm việc
Poolside không giải thích bản nâng cấp này chỉ bằng việc tăng tham số. Hãng nhấn mạnh mô hình kiểm tra nhiều hơn, ít mặc định là đúng hơn, không tuyên bố hoàn tất quá sớm, và bền bỉ hơn.
"What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent."
Pengming Wang, đồng phụ trách nghiên cứu ứng dụng của Poolside, đang nói về nếp làm việc của một coding agent: bớt suy đoán, xác minh nhiều hơn, và không dừng khi kiểm thử chưa thật sự xong.
Các ví dụ của Poolside đi cùng thông điệp đó. Laguna S 2.1 được cho là đã xây một engine render HTML/CSS đơn giản từ thư mục trống trong phiên 50 phút với 181 bước. Ở một nhiệm vụ tối ưu harness nội bộ khác, mô hình tăng tốc độ 5,2% và giảm phân bổ bộ nhớ khoảng 70%. Những ví dụ này chưa đại diện cho mọi khách hàng, nhưng cho thấy Poolside muốn bán khả năng tự kiểm chứng trong các tác vụ kỹ thuật dài hơi.
Khoảng trống của open weight
Một năm qua, tiếng vang của mô hình lập trình open-weight chủ yếu đến từ các nhóm Trung Quốc như Kimi K3, Qwen, DeepSeek và MiniMax. Ở phía phương Tây, nhiều công ty hoặc bán API đóng, hoặc có mô hình mở chưa đủ ấn tượng về quy mô và năng lực lập trình.
Kích thước 118B-A8B của Laguna S 2.1 là một điểm cân bằng: chịu được nhiệm vụ dài tốt hơn lớp 30B, nhưng dễ triển khai hơn mô hình nghìn tỷ tham số. Model card trên Hugging Face xác nhận bản NVFP4 dùng giấy phép OpenMDW-1.1. vLLM Recipes lưu ý trọng số BF16 khoảng 235GB, vì vậy bản lượng tử hóa thực tế hơn cho desktop và cụm nhiều GPU.
Với doanh nghiệp chịu quản lý, khác biệt này rất cụ thể. Mã nguồn, lỗ hổng, dữ liệu khách hàng và log nội bộ không phải lúc nào cũng được phép gửi vào API đóng ở nước ngoài. Khả năng chạy cục bộ, trọng số và giấy phép có thể kiểm toán, cùng kết nối với vLLM, SGLang, Ollama, OpenRouter và Vercel AI Gateway có thể quan trọng hơn vài điểm benchmark.
Cái giá nằm ở phần hạn chế
Poolside cũng công khai nhược điểm. Trong agent harness của bên thứ ba, mô hình có thể nhớ quá nhiều định dạng công cụ của Poolside và dùng sai schema tương tự nhưng khác. Lời gọi công cụ lồng nhau có thể sinh JSON escape sai. Thinking mode đôi khi suy nghĩ quá lâu, nhất là với bài toán thi đấu.
Ba hạn chế này chỉ vào cùng một rủi ro: coding agent không chỉ thất bại vì không viết được code. Vấn đề thường nằm ở giao thức công cụ, ngân sách ngữ cảnh và thời điểm dừng. Khi mô hình được nối vào CI, repository, ticket và hệ thống quyền, một lệnh gọi công cụ sai có thể rắc rối hơn một câu trả lời sai.
Poolside cũng nêu khung chi phí. Endpoint miễn phí của OpenRouter cung cấp ngữ cảnh 256K; endpoint trả phí chuyên dụng cung cấp đủ 1 triệu ngữ cảnh, với giá 0,10 USD mỗi triệu token input, 0,20 USD mỗi triệu token output, và 0,01 USD mỗi triệu token đọc cache. Rẻ hơn nhiều so với mô hình đóng frontier, nhưng một phiên agent dài có thể sinh hàng trăm nghìn token output.
Phép thử sẽ nằm trong repository
Vị trí của Laguna S 2.1 khá rõ: không nhắm ngôi đầu bảng tổng của mô hình đóng, mà là nền tảng coding agent có thể tải về, tự host và gắn vào stack suy luận hiện có cho doanh nghiệp phương Tây.
Các tín hiệu tiếp theo cũng thực tế: lượt tải Hugging Face và tái lập từ cộng đồng có bền không; vLLM, Ollama và SGLang có ổn định trong repository thật không; thế hệ Laguna lớn hơn có thu hẹp khoảng cách Terminal-Bench không; và giấy phép OpenMDW có thuận tiện cho kiểm tra tuân thủ thương mại không.
Nếu các điểm đó chạy được, giá trị của Laguna S 2.1 không nằm ở khẩu hiệu “DeepSeek phương Tây”. Nó là câu trả lời dễ hiểu hơn cho bộ phận mua sắm: mã nguồn ở lại nội bộ, mô hình có thể sửa repository trong phiên dài, hóa đơn tính được, và khoảng cách năng lực đã đủ nhỏ để thử trên dự án thật.
Nguồn: blog chính thức Poolside, model card Hugging Face, vLLM Recipes, CocoLoop, The Next Web; đã kiểm tra tham số mô hình, tham số hoạt động, cửa sổ ngữ cảnh, cách đọc benchmark, phần cứng huấn luyện, giấy phép, triển khai suy luận và các hạn chế công khai.