Poolside開源118B程式模型

Poolside這次沒有端出萬億參數的龐然大物。Laguna S 2.1是118B總參數、8B啟用參數的MoE程式模型,權重放上Hugging Face,官方還說可在單台NVIDIA DGX Spark上運行。

新聞的抓手在這裡:歐美公司終於拿出一個可自託管的開放權重程式模型,但它沒有宣稱打穿GPT或Claude。官方榜單裡,Laguna S 2.1在Terminal-Bench 2.1是70.2%,離閉源前沿還有距離;Poolside押的是企業願意為了資料留在本機器裡,接受這段差距。

先把體積壓到能部署

Poolside官方博客寫明,Laguna S 2.1支援最高1M token上下文,從開始訓練到發布不到9週。官方列出的成績包括Terminal-Bench 2.1 70.2%、SWE-Bench Multilingual 78.5%、SWE-Bench Pro公開資料集59.4%、DeepSWE 40.4%。

這組數字不能混讀。70.2%來自Poolside自家agent harness;40.4%來自DeepSWE thinking mode。官方也承認部分比較採用廠商自報、榜單或第三方最高值,因此更適合看位置,不能當成精確橫評。

直接引語說的是工作習慣

What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent.

Pengming Wang這句話的中文意思很直白:這次強化的重點是「幹活習慣」,多驗證,少想當然,不要測試沒全過就收工。

官方案例裡,Laguna S 2.1在50分鐘、181步會話中從空資料夾做出簡單HTML/CSS渲染引擎;另一個內部harness優化任務中,速度提高5.2%,記憶體分配降低約70%。

開放權重的空檔

過去一年,開放權重程式模型的聲量更多來自中國團隊。Kimi、Qwen、DeepSeek、MiniMax都在參數規模、授權、低價API和本地部署上輪番衝榜。Laguna S 2.1選在118B-A8B體量,是比30B級模型更能撐長任務、比萬億模型更容易落地的折中點。

Hugging Face模型卡確認NVFP4版本採用OpenMDW-1.1授權,vLLM Recipes提醒BF16權重大約235GB,預設不適合單卡,量化版本才是桌面和多GPU節點更現實的選擇。

代價也寫在限制裡

Poolside沒有把短板藏起來。官方列出的限制包括:在第三方agent harness裡可能過度記住自家工具格式;嵌套工具呼叫可能生成轉義錯誤的JSON;thinking mode有時會想得過久。

OpenRouter免費端點提供256K上下文,專用付費端點提供完整1M上下文,價格為每百萬token 0.10美元輸入、0.20美元輸出、0.01美元快取讀取。這比閉源前沿模型便宜許多,但長程agent一次會話動輒十萬到幾十萬輸出token。

真正的驗證在倉庫裡

接下來要看的指標很具體:Hugging Face下載與社群復現、vLLM/Ollama/SGLang推理路徑在真實倉庫裡是否穩定、下一代Laguna能不能縮小Terminal-Bench差距、OpenMDW授權在商業合規審查中是否順手。

Laguna S 2.1的價值不在「西方版DeepSeek」這句口號。它更像一個採購部門能理解的答案:程式碼可以留在本地,模型能長時間改倉庫,帳單可以算清,能力差距已經小到可以拿真實專案試。

參考來源:Poolside官方博客、Hugging Face模型卡、vLLM Recipes、CocoLoop、The Next Web;核驗模型參數、啟用參數、上下文窗口、benchmark口徑、訓練硬體、授權、推理部署和公開限制。