Inkling Small追平975B旗艦

Mira Murati 的 Thinking Machines 在 7 月 30 日放出了 Inkling-Small。这个名字里的 “Small” 容易误导人:它仍是一个 **2760 亿总參數、120 亿啟用參數** 的 MoE 多模態模型,只是放在 9750 亿总參數的 Inkling 旁边显得小。 它最有新闻性的地方,是把全量权重、模型卡和部署入口一起给了开发者。半个月前,Inkling 还是一台需要重型算力才能靠近的旗舰;这次 Small 版本把同一条路线压到更低成本,还在若干推理和编码指标上反超了大模型。 ## 学生先追上了老师 官方發布页给出的解释很直接:Inkling-Small 晚于 Inkling 开训,因此訓練数据配比和机器学习配方都吃到了上一轮经验;随后先用 Inkling 做 on-policy distillation,再从 preview 检查点继续跑 **两周智能体编码强化学习**。 Thinking Machines 在发布页里写道: > “Inkling-Small’s combination of broad performance and efficiency will make it easy to experiment with and test in real applications.” 自然翻成中文,就是它想把“能试、能调、能进应用”的门槛降下来,而不只是在榜单上给旗舰做一个缩小版。 模型卡把结构写得更细:它是 **42 层 decoder-only Transformer**,稀疏 MoE 前馈骨干里每个 token 路由到 **256 个专家中的 6 个**,另有 **2 个共享专家**始终啟用;输入支持文本、图像和音频,输出为文本;上下文窗口最高 **100 万 token**;授權证是 **Apache 2.0**。 这些数字说明一件事:Inkling-Small 距离“端侧小模型”很远,也超出普通聊天模型的范畴。它更像一块可二次訓練、可私有部署、能接工具链的基础模型坯料。 ## 12B 啟用參數为什么被盯上 36氪/新智元把开发者最关心的点挑了出来:原版 Inkling 的 BF16 检查点最低要 **2TB 聚合显存**,示例配置是 8 张 B300 或 16 张 H200;NVFP4 量化版也要 **600GB 起步**。Inkling-Small 的部署门槛低了一档。 vLLM recipes 给出的部署口径更具体:Inkling-Small 的 NVFP4 变体至少需要 **180GB 聚合 VRAM**;BF16 变体至少需要 **600GB 聚合 VRAM**。这仍然高出个人电脑级别,但已经从“只有超大实验室顺手可用”,降到中等团队或云上专用实例可以认真评估的区间。 这也是它对中文开发者有增量价值的地方。过去一年,国内讨论開源权重模型时,经常把“总參數”和“能不能真跑起来”混在一起。MoE 模型的成本感知要看啟用參數、量化格式、并行方式、上下文长度和推理框架支持,不能只看 276B 这个总量。 ## 榜单有亮点,也有边界 官方模型卡给出的分数很亮眼:Inkling-Small 在 AA Index v4.1 上是 **40.0%**,Inkling 是 **41.0%**;SWE-bench Verified 是 **80.2%**,高于 Inkling 的 **77.6%**;Terminal Bench 2.1 best harness 是 **64.7%**,略高于 Inkling 的 **63.8%**;HLE text only 是 **31.6%**,高于 Inkling 的 **29.7%**;ARC-AGI-2 是 **40.1%**,高于 Inkling 的 **36.5%**。 Artificial Analysis 的独立文章给了另一组更克制的口径:Inkling Small 在 Intelligence Index 上得 **40 分**,距离 Inkling 的 **41 分**只差 1 分;在同尺寸或更小開源权重模型里,没有更高分的模型。它同时提醒,Inkling-Small 在 τ³-Banking、事实知识和 AA-Omniscience 上仍落后旗舰。 这组交叉核验很有用。官方發布适合看能力展开,第三方测评适合看边界。Inkling-Small 的叙事应当避开“全面击败旗舰”的夸张说法。更准确的口径是:它在较低啟用成本下,把推理、编码和多模態通用能力推到了足以替代部分旗舰试验的位置。 ## 压力给到了開源交付 Inkling-Small 对国内模型厂商的压力,来自一整套交付动作:发布全量权重、给出模型卡细节、同步 Hugging Face/vLLM/SGLang 等部署路径。開源权重下载之外,还要交付从評測到推理框架的可用路径。 Hugging Face 已经给出模型页和使用入口,vLLM recipes 也列出 NVFP4、BF16 和硬件要求。对企业团队来说,下一步验证指标非常具体:在自己的代码库、语音/图像输入、长上下文 RAG 或 Agent harness 里,它的 12B 啟用成本能否抵消 276B 总參數带来的部署复杂度。 Thinking Machines 的公司故事仍有不稳定性。36氪/新智元提到,六位联合创始人已有多人离开,翁荔回归 OpenAI 后,公司很快发出 Inkling-Small。团队波动会影响长期路线,但这次发布至少证明了一点:第一代旗舰并非孤例,模型产线已经开始产出第二个可用形态。 后续要看的焦点离不开三类真实反馈:开发者能否在 180GB/600GB 级别配置上稳定部署,微调后的垂直任务是否超过闭源 API 的性价比,以及外部評測能否复现官方在编码、推理和多模態上的优势。跑通这三关,Inkling-Small 才算从一份漂亮模型卡变成一块可用基础设施。

參考來源:36氪/新智元、Thinking Machines 官方發布、CocoLoop、Inkling-Small 模型卡、Artificial Analysis、Hugging Face、vLLM Recipes;官方与模型卡核验发布节点、參數、授權、上下文、訓練和 benchmark 口径,Artificial Analysis 与 vLLM/Hugging Face 核验第三方分数和部署门槛。