百靈小模型開始跑本地智能體

百靈這次開源的小模型,最容易被看成又一個「參數更小」的發布。但它要搶的位置,是本地智能體的運行底座。

8月11日,螞蟻集團百靈大模型開源 Ling-3.0-tiny。界面新聞給出發布線索:模型總參數量 7.9B,推理時每個 token 僅激活 1.3B 參數,同步提供 BF16、FP8 和 INT4 三種權重。Hugging Face 模型卡、ModelScope 頁面和 SGLang 文檔給了更完整的技術口徑。

“We are introducing Ling-3.0-tiny, a lightweight hybrid reasoning MoE model”

小參數為何盯上智能體

Ling-3.0-tiny 採用 3:1 的 KDA 與 MLA 交替堆疊結構,每 4 層裡有 3 層 Kimi Delta Attention、1 層 Multi-Head Latent Attention;前饋網路使用 128 個路由專家,每個 token 激活 8 個路由專家和 1 個共享專家。

這串結構名指向一個目標:長上下文、低顯存和智能體任務要同時成立。傳統小模型可以便宜,但碰到長任務、代碼環境、工具調用和多輪決策,容易在上下文和規劃上斷掉。百靈把 Ling-3.0-tiny 放在 agentic workflows 語境裡,說明它想服務的是能持續讀文件、調工具、寫代碼、改結果的執行場景。

本地部署是主菜

官方模型卡稱,Ling-3.0-tiny 已在 NVIDIA DGX Spark、Apple Silicon MacBook 和 Mac mini 上驗證;FP8 權重在 DGX Spark 上約 100-105 tokens/s,在 M4 Pro MacBook 上約 86-90 tokens/s;8K 上下文長度下峰值記憶體約 8.34 GiB。

這組數字把模型拉回到用戶手裡的機器:一台較新的 MacBook 或小型工作站,開始有機會跑帶推理和工具能力的本地智能體。資料不必每次出本機,成本也從按 token 計費轉成設備折舊和電費。

限制也清楚。SGLang 推薦的低延遲方案仍提到 141GB 級 GPU 或單卡 Blackwell 節點,用來支撐 256K YaRN 上下文、NEXTN 推測解碼和長上下文服務。MacBook 上的速度數字來自 FP8、本地硬體和 8K 上下文口徑,不能直接拿來承諾 256K 長任務體驗。

第三方評測給了邊界

模型卡稱 Ling-3.0-tiny 在 Artificial Analysis Intelligence Index v4.1.1 得分 25,在 Agentic Index 得分 16;該測試裡輸出速度超過 160 tokens/s,包含推理時間的 500-token 回應端到端延遲約 18 秒。

這些分數說明它並非旗艦模型。它的價值在於每個激活參數能做多少事。同一平台上,Ling-3.0-flash 得分更高,但總參數和激活參數也大得多。tiny 版更像一顆邊緣側執行核心:不追求最大腦力,先把可運行、可調用、可長期駐留做出來。

下一步看三個節點:SGLang 與 vLLM 對 Ling-3.0 的支持能否穩定進入主線,INT4 版本在普通消費級設備上的實際任務成功率怎樣,以及開發者會不會把它接進 IDE、瀏覽器自動化和企業內網工具。模型卡給了啟動方式,含金量要在長任務裡跑出來。

參考來源:Hugging Face 模型卡、ModelScope、界面新聞、Artificial Analysis、CocoLoop、SGLang 文檔;核驗 7.9B 總參數、1.3B 激活參數、BF16/FP8/INT4 權重、KDA/MLA 與 128 專家結構、本地 DGX Spark/M4 Pro 速度、8K 記憶體口徑、Artificial Analysis 指數和 256K SGLang 部署口徑。