Poolside 開源 118B 程式碼模型

Poolside 這次沒有用兆級參數模型搶聲量。它把 Laguna S 2.1 做成總參數 118B、啟用參數 8B的 MoE 程式碼模型,權重已放上 Hugging Face,並表示可在單台 NVIDIA DGX Spark 上運行。

這則消息的關鍵,是歐美公司終於拿出一個可自託管的開放權重程式碼模型。不過 Poolside 沒有宣稱打敗 GPT 或 Claude。官方榜單中,Laguna S 2.1 在 Terminal-Bench 2.1 上是 70.2%,距離閉源前沿仍有差距。它押注的是:若程式碼和日誌能留在企業自己的機器裡,企業可能願意接受這段能力差。

先把規模壓到能部署

Poolside 官方博客寫得很具體:Laguna S 2.1 是 118B total parameter、8B activated parameter 的 Mixture-of-Experts 模型,支援最高100 萬 token 上下文,從開始訓練到發布不到 9 週。

模型主要面向 agentic coding。官方列出的成績包括 Terminal-Bench 2.1 70.2%、SWE-Bench Multilingual 78.5%、SWE-Bench Pro 公開資料集 59.4%、DeepSWE 40.4%。The Next Web 對照後也指出,它在 Terminal-Bench 和 SWE-Bench Pro 上接近或超過多款更大的開放模型,但閉源模型仍領先約 10 到 15 個百分點。

這組數字不能混在一起讀。70.2% 來自 Poolside 自家 agent harness 的 Terminal-Bench 2.1;40.4% 來自 DeepSWE thinking mode,同一口徑下 no-thinking 只有 16.5%。官方也承認,部分比較採用廠商自報、榜單或第三方最高值,因此更適合看相對位置,而不是精確橫評。

直接引語說的是工作習慣

Poolside 沒把這次升級說成單純加參數。它強調模型更會檢查、更願意回退、更少提前宣布完成。

"What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent."

Poolside 應用研究聯合負責人 Pengming Wang 這句話的意思是:增強重點在「做事習慣」,少想當然、多驗證,別在測試沒全過時就收工。

官方案例也能對上這個解釋。Laguna S 2.1 在一個 50 分鐘、181 步的會話裡,從空資料夾做出簡單 HTML/CSS 渲染引擎;另一個內部 harness 最佳化任務中,模型把速度提高5.2%,記憶體分配降低約70%。這些案例不一定代表真實客戶場景,但說明 Poolside 想賣的是長時間工程任務中的自我校驗能力。

開放權重的空檔

過去一年,開放權重程式碼模型的聲量更多來自中國團隊。Kimi K3、Qwen、DeepSeek、MiniMax 都在參數規模、授權、低價 API 和本地部署上輪番衝榜。歐美公司這邊,要麼閉源賣 API,要麼開放模型的尺寸和程式碼能力不夠刺激。

Laguna S 2.1 選在 118B-A8B 這個體量,像是一個折衷點:比 30B 級模型更能支撐長任務,比兆級參數模型更容易落地。Hugging Face 模型卡確認 NVFP4 版本採用 OpenMDW-1.1 授權,vLLM Recipes 則提醒 BF16 權重大約235GB,預設並不適合單卡,量化版本才是桌面和多 GPU 節點更實際的選擇。

對受監管企業來說,這個差別很實在。程式碼、漏洞、客戶資料和內部系統日誌不一定能送進海外閉源 API。能本地跑、能審計權重和授權、能接 vLLM/SGLang/Ollama/OpenRouter/Vercel AI Gateway,比跑分高幾分更容易進採購表。

代價也寫在限制裡

Poolside 沒把短板藏起來。官方列出的限制包括:在第三方 agent harness 裡可能過度記住自家工具格式,遇到相似但不同的 schema 時會誤用;巢狀工具呼叫可能生成跳脫錯誤的 JSON;thinking mode 有時會想得過久,尤其在競賽數學題上。

這三條限制都指向同一個風險:程式碼 agent 的失敗不總是「不會寫程式碼」,更多時候是工具協議、上下文預算和停手時機。企業把模型接進 CI、倉庫、工單和權限系統後,一次錯誤工具呼叫可能比答錯一道題更麻煩。

Poolside 也給出成本口徑。OpenRouter 免費端點提供256K 上下文,專用付費端點提供完整 100 萬上下文,價格為每百萬 token 0.10 美元輸入、0.20 美元輸出、0.01 美元快取讀取。這比閉源前沿模型便宜許多,但長程 agent 一次會話動輒十萬到數十萬輸出 token,便宜也會被工作時長吃掉。

驗證會發生在倉庫裡

Laguna S 2.1 的產業位置很清楚:它不是衝著閉源總榜第一去,而是給歐美企業一個可下載、可自託管、能接既有推理棧的程式碼 agent 底座。

後續要看的指標也具體。第一,Hugging Face 下載和社群復現是否能撐住;第二,vLLM、Ollama、SGLang 等推理路徑在真實倉庫裡是否穩定;第三,Poolside 下一代更大 Laguna 模型能不能縮小 Terminal-Bench 的差距;第四,OpenMDW 授權在商業合規審查中是否足夠順手。

如果這些點跑通,Laguna S 2.1 的價值不在「西方版 DeepSeek」這個口號。它更像一個採購部門能理解的答案:程式碼可以留在本地,模型能長時間改倉庫,帳單可以算清,能力離前沿還差一點,但差距已小到可以拿真實專案試。

參考來源:Poolside 官方博客、Hugging Face 模型卡、vLLM Recipes、CocoLoop、The Next Web;核驗模型參數、啟用參數、上下文窗口、benchmark 口徑、訓練硬體、授權、推理部署和公開限制。