Inkling Small追平975B旗舰

Mira Murati 的 Thinking Machines 在 7 月 30 日放出了 Inkling-Small。这个名字里的 “Small” 容易误导人:它仍是一个 2760 亿总参数、120 亿激活参数 的 MoE 多模态模型,只是放在 9750 亿总参数的 Inkling 旁边显得小。

它最有新闻性的地方,是把全量权重、模型卡和部署入口一起给了开发者。半个月前,Inkling 还是一台需要重型算力才能靠近的旗舰;这次 Small 版本把同一条路线压到更低成本,还在若干推理和编码指标上反超了大模型。

学生先追上了老师

官方发布页给出的解释很直接:Inkling-Small 晚于 Inkling 开训,因此训练数据配比和机器学习配方都吃到了上一轮经验;随后先用 Inkling 做 on-policy distillation,再从 preview 检查点继续跑 两周智能体编码强化学习

Thinking Machines 在发布页里写道:

“Inkling-Small’s combination of broad performance and efficiency will make it easy to experiment with and test in real applications.”

自然翻成中文,就是它想把“能试、能调、能进应用”的门槛降下来,而不只是在榜单上给旗舰做一个缩小版。

模型卡把结构写得更细:它是 42 层 decoder-only Transformer,稀疏 MoE 前馈骨干里每个 token 路由到 256 个专家中的 6 个,另有 2 个共享专家始终激活;输入支持文本、图像和音频,输出为文本;上下文窗口最高 100 万 token;许可证是 Apache 2.0

这些数字说明一件事:Inkling-Small 距离“端侧小模型”很远,也超出普通聊天模型的范畴。它更像一块可二次训练、可私有部署、能接工具链的基础模型坯料。

12B 激活参数为什么被盯上

36氪/新智元把开发者最关心的点挑了出来:原版 Inkling 的 BF16 检查点最低要 2TB 聚合显存,示例配置是 8 张 B300 或 16 张 H200;NVFP4 量化版也要 600GB 起步。Inkling-Small 的部署门槛低了一档。

vLLM recipes 给出的部署口径更具体:Inkling-Small 的 NVFP4 变体至少需要 180GB 聚合 VRAM;BF16 变体至少需要 600GB 聚合 VRAM。这仍然高出个人电脑级别,但已经从“只有超大实验室顺手可用”,降到中等团队或云上专用实例可以认真评估的区间。

这也是它对中文开发者有增量价值的地方。过去一年,国内讨论开源权重模型时,经常把“总参数”和“能不能真跑起来”混在一起。MoE 模型的成本感知要看激活参数、量化格式、并行方式、上下文长度和推理框架支持,不能只看 276B 这个总量。

榜单有亮点,也有边界

官方模型卡给出的分数很亮眼:Inkling-Small 在 AA Index v4.1 上是 40.0%,Inkling 是 41.0%;SWE-bench Verified 是 80.2%,高于 Inkling 的 77.6%;Terminal Bench 2.1 best harness 是 64.7%,略高于 Inkling 的 63.8%;HLE text only 是 31.6%,高于 Inkling 的 29.7%;ARC-AGI-2 是 40.1%,高于 Inkling 的 36.5%

Artificial Analysis 的独立文章给了另一组更克制的口径:Inkling Small 在 Intelligence Index 上得 40 分,距离 Inkling 的 41 分只差 1 分;在同尺寸或更小开源权重模型里,没有更高分的模型。它同时提醒,Inkling-Small 在 τ³-Banking、事实知识和 AA-Omniscience 上仍落后旗舰。

这组交叉核验很有用。官方发布适合看能力展开,第三方测评适合看边界。Inkling-Small 的叙事应当避开“全面击败旗舰”的夸张说法。更准确的口径是:它在较低激活成本下,把推理、编码和多模态通用能力推到了足以替代部分旗舰试验的位置。

压力给到了开源交付

Inkling-Small 对国内模型厂商的压力,来自一整套交付动作:发布全量权重、给出模型卡细节、同步 Hugging Face/vLLM/SGLang 等部署路径。开源权重下载之外,还要交付从评测到推理框架的可用路径。

Hugging Face 已经给出模型页和使用入口,vLLM recipes 也列出 NVFP4、BF16 和硬件要求。对企业团队来说,下一步验证指标非常具体:在自己的代码库、语音/图像输入、长上下文 RAG 或 Agent harness 里,它的 12B 激活成本能否抵消 276B 总参数带来的部署复杂度。

Thinking Machines 的公司故事仍有不稳定性。36氪/新智元提到,六位联合创始人已有多人离开,翁荔回归 OpenAI 后,公司很快发出 Inkling-Small。团队波动会影响长期路线,但这次发布至少证明了一点:第一代旗舰并非孤例,模型产线已经开始产出第二个可用形态。

后续要看的焦点离不开三类真实反馈:开发者能否在 180GB/600GB 级别配置上稳定部署,微调后的垂直任务是否超过闭源 API 的性价比,以及外部评测能否复现官方在编码、推理和多模态上的优势。跑通这三关,Inkling-Small 才算从一份漂亮模型卡变成一块可用基础设施。

参考来源:36氪/新智元、Thinking Machines 官方发布、CocoLoop、Inkling-Small 模型卡、Artificial Analysis、Hugging Face、vLLM Recipes;官方与模型卡核验发布节点、参数、许可、上下文、训练和 benchmark 口径,Artificial Analysis 与 vLLM/Hugging Face 核验第三方分数和部署门槛。