百灵小模型开始跑本地智能体

百灵这次开源的小模型,乍看像又一个“参数更小”的发布。但它要抢的位置,是本地智能体的运行底座。

8 月 11 日,蚂蚁集团百灵大模型开源 Ling-3.0-tiny。界面新闻的快讯给出发布线索:模型总参数量 7.9B,推理时每个 token 仅激活 1.3B 参数,同步提供 BF16、FP8 和 INT4 三种权重。Hugging Face 模型卡、ModelScope 页面和 SGLang 文档随后给了更完整的技术口径。

官方模型卡把它定义为轻量级混合推理 MoE 模型,并直接写道:

“We are introducing Ling-3.0-tiny, a lightweight hybrid reasoning MoE model”

自然翻成中文,就是百灵想做的方向并非缩小版聊天模型。它更像一台低成本推理引擎:能快速回答,也能在需要时打开多步思考和工具调用。

小参数为何盯上智能体

Ling-3.0-tiny 采用 3:1 的 KDA 与 MLA 交替堆叠结构,每 4 层里有 3 层 Kimi Delta Attention、1 层 Multi-Head Latent Attention;前馈网络部分使用 128 个路由专家,每个 token 激活 8 个路由专家和 1 个共享专家。

这串结构名听起来很工程化,实际指向一个目标:长上下文、低显存和智能体任务要同时成立。传统小模型可以便宜,但一碰到长任务、代码环境、工具调用和多轮决策,容易在上下文和规划上断掉。百灵把 Ling-3.0-tiny 放在“agentic workflows”语境里,说明它想服务的场景已越过单轮问答,转向能持续读文件、调工具、写代码、改结果的执行任务。

Hugging Face 模型卡给出几个可核数字:总参数 7.9B,激活参数 1.3B;思考模式可通过 enable_thinking 控制;默认建议采样参数为 temperature=1.0top_p=0.95top_k=20。这些数字不该被读成“性能碾压”。它们更像部署说明书,告诉开发者模型在什么模式下工作。

本地部署是这次发布的主菜

百灵把设备口径写得很细。官方模型卡称,Ling-3.0-tiny 已在 NVIDIA DGX Spark、Apple Silicon MacBook 和 Mac mini 上验证;FP8 权重在 DGX Spark 上约 100-105 tokens/s,在 M4 Pro MacBook 上约 86-90 tokens/s;8K 上下文长度下峰值内存约 8.34 GiB。

这组数字比“模型很强”更有用。它把模型拉回到用户手里的机器:一台较新的 MacBook 或小型工作站,开始有机会跑带推理和工具能力的本地智能体。对国内开发者来说,这比云端 API 多一个现实选择:数据不必每次出本机,成本也从按 token 计费转成设备折旧和电费。

但限制也很清楚。官方推荐的 SGLang 低延迟方案仍提到 141GB 级 GPU 或单卡 Blackwell 节点,用来支撑 256K YaRN 上下文、NEXTN 推测解码和长上下文服务。MacBook 上的速度数字来自 FP8、本地硬件和 8K 上下文口径,不能直接拿来承诺 256K 长任务体验。

第三方评测给了边界

Artificial Analysis 的口径让这次发布更容易放进坐标系。模型卡称 Ling-3.0-tiny 在 Artificial Analysis Intelligence Index v4.1.1 得分 25,在 Agentic Index 得分 16;该测试里输出速度超过 160 tokens/s,包含推理时间的 500-token 响应端到端延迟约 18 秒。

这些分数说明它并非旗舰模型。它的价值在于“每个激活参数能做多少事”。同一平台上,Ling-3.0-flash 的 Intelligence Index 得分更高,但总参数和激活参数也大得多。tiny 版更像一颗边缘侧执行芯片旁边的模型内核:不追求最大脑力,先把可运行、可调用、可长期驻留做出来。

这也解释了为什么权重形态要同时给 BF16、FP8 和 INT4。BF16适合保留精度,FP8服务吞吐和显存平衡,INT4把门槛继续压低。开发者会比较的,不会只有榜单分数,还包括能否在现有硬件上稳定启动、工具调用是否顺手、长任务是否会掉线。

百灵在补一块本地空白

过去一个月,站内已经写过 Meta Muse Glimmer、DeepSeek、Qwen、Claude Code 等智能体和开源模型方向。Ling-3.0-tiny 放进这条线里,位置很清楚:它并非最大参数的国产模型,也并非一次应用层功能更新;它是在“本地可跑的智能体模型”这条缝里补位。

中文生态里的本地智能体一直缺一个足够轻、可商用、部署文档完整、又不只会聊天的底座。Ling-3.0-tiny 用 MIT 许可证、Hugging Face/ModelScope 双平台、SGLang 和 vLLM 路径把入口铺出来,门槛已经比许多只给 API 的模型低。

下一步看三个节点:SGLang 与 vLLM 对 Ling-3.0 的支持能否稳定进入主线,INT4 版本在普通消费级设备上的实际任务成功率怎样,以及国内开发者会不会把它接进 IDE、浏览器自动化和企业内网工具。模型卡给了启动方式,含金量要在这些长任务里跑出来。

参考来源:Hugging Face 模型卡、ModelScope、界面新闻、Artificial Analysis、CocoLoop、SGLang 文档;核验 7.9B 总参数、1.3B 激活参数、BF16/FP8/INT4 权重、KDA/MLA 与 128 专家结构、本地 DGX Spark/M4 Pro 速度、8K 内存口径、Artificial Analysis 指数和 256K SGLang 部署口径。