Poolside 这次没有端出一个万亿参数的庞然大物。它把 Laguna S 2.1 做成 118B 总参数、8B 激活参数 的 MoE 代码模型,权重直接放上 Hugging Face,还说能在单台 NVIDIA DGX Spark 上跑。
这条新闻的抓手在这里:欧美公司终于拿出一个可自托管的开放权重代码模型,但它没有宣称打穿 GPT 或 Claude。官方榜单里,Laguna S 2.1 在 Terminal-Bench 2.1 上是 70.2%,离闭源前沿还有一截;Poolside 要押的,是企业愿意为了数据留在自己机器里,接受这一截差距。
先把体积压到能部署
Poolside 官方博客写得很具体:Laguna S 2.1 是 118B total parameter、8B activated parameter 的 Mixture-of-Experts 模型,支持最高 1M token 上下文,从开始训练到发布不到 9 周。
模型主要面向 agentic coding。官方列出的成绩包括 Terminal-Bench 2.1 70.2%、SWE-Bench Multilingual 78.5%、SWE-Bench Pro 公共数据集 59.4%、DeepSWE 40.4%。The Next Web 对照后也给出同一组量级判断:它在 Terminal-Bench 和 SWE-Bench Pro 上接近或超过多款更大的开放模型,但闭源模型仍领先约 10 到 15 个百分点。
这组数字不能混着读。70.2% 来自 Poolside 自家 agent harness 的 Terminal-Bench 2.1;40.4% 来自 DeepSWE thinking mode,同一口径下 no-thinking 只有 16.5%。官方自己也承认,部分比较采用厂商自报、榜单或第三方最高值,因此更适合看位置,不能当成精确横评。
直接引语说的是工作习惯
Poolside 没把这次升级解释成单纯加参数。它强调模型更会检查、更愿意回退、更少提前宣布完成。
“What we’ve done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent.”
Poolside 应用研究联合负责人 Pengming Wang 这句话翻成中文,就是:这次增强的重点在“干活习惯”,少想当然、多验证,别测试没全过就收工。
这个解释和它放出的案例能对上。官方写到,Laguna S 2.1 在一个 50 分钟、181 步的会话里,从空文件夹做出一个简单 HTML/CSS 渲染引擎;另一个内部 harness 优化任务里,模型把速度提高 5.2%,内存分配降低约 70%。这些案例未必能代表真实客户场景,但至少说明 Poolside 想卖长时间工程任务里的自我校验,聊天能力只是入口。
开放权重的空档
过去一年,开放权重代码模型的声量更多来自中国团队。Kimi K3、Qwen、DeepSeek、MiniMax 都在参数规模、许可证、低价 API 和本地部署上轮番冲榜。欧美公司这边,要么闭源卖 API,要么开放的模型尺寸和代码能力不够刺激。
Laguna S 2.1 选在 118B-A8B 这个体量,很像一个折中点:比 30B 级模型更能撑长任务,比万亿参数模型更容易落地。Hugging Face 模型卡确认 NVFP4 版本采用 OpenMDW-1.1 许可证,vLLM Recipes 则给出工程侧提醒:BF16 权重大约 235GB,默认不适合单卡,量化版本才是桌面和多 GPU 节点更现实的选择。
对受监管企业,这个差别很实在。代码、漏洞、客户数据和内部系统日志不一定能送进海外闭源 API。能本地跑、能审计权重和许可证、能接 vLLM/SGLang/Ollama/OpenRouter/Vercel AI Gateway,这些比跑分高几分更容易进采购表。
代价也写在限制里
Poolside 没把短板藏起来。官方列出的限制包括:在第三方 agent harness 里可能过度记住自家工具格式,遇到相似但不同的 schema 时会误用;嵌套工具调用可能生成转义错误的 JSON;thinking mode 有时会想得过久,尤其在竞赛数学题上。
这三条限制都指向同一个风险:代码 agent 的失败不总是“不会写代码”,更多时候是工具协议、上下文预算和停手时机。企业把模型接进 CI、仓库、工单和权限系统后,错一次工具调用可能比答错一道题更麻烦。
Poolside 也给出了成本口径。OpenRouter 免费端点提供 256K 上下文,专用付费端点提供完整 1M 上下文,价格为每百万 token 0.10 美元输入、0.20 美元输出、0.01 美元缓存读取。这比闭源前沿模型便宜许多,但长程 agent 一次会话动辄十万到几十万输出 token,便宜也会被工作时长吃掉。
验证会发生在仓库里
Laguna S 2.1 的产业位置很清楚:它并未冲着闭源总榜第一去,给欧美企业的角色是一个可下载、可自托管、能接现有推理栈的代码 agent 底座。
后续要看的指标也具体。第一,Hugging Face 下载和社区复现是否能撑住;第二,vLLM、Ollama、SGLang 等推理路径在真实仓库里是否稳定;第三,Poolside 下一代更大 Laguna 模型能不能把 Terminal-Bench 的差距再缩小;第四,OpenMDW 许可证在商业合规审查中是否足够顺手。
如果这些点跑通,Laguna S 2.1 的价值不在“西方版 DeepSeek”这个口号。它更像一个采购部门能理解的答案:代码可以留在本地,模型能长时间改仓库,账单可以算清,能力离前沿还差一点,但差距已经小到可以拿真实项目试。
参考来源:Poolside 官方博客、Hugging Face 模型卡、vLLM Recipes、CocoLoop、The Next Web;核验模型参数、激活参数、上下文窗口、benchmark 口径、训练硬件、许可证、推理部署和公开限制。