月之暗面上週把 Kimi K2.6 完整版推出來了,這不是什麼「程式碼預覽」測試版,而是完整的生產級模型。之前的 Code Preview 已經引發一波關注,但完整版的技術規格與跑分結果出爐後,情況比許多人預期的更有意思。
HLE-Full 54.0,開源第一是真的拿到了
HLE(Humanity's Last Exam)是今年 AI 評測中含金量最高的榜單之一,2,500 道博士級別的題目橫跨 100 多個學術領域,不是那種靠 few-shot 就能矇混過關的測試。
Kimi K2.6 的成績:
| 模型 | HLE-Full(含工具) |
|---|---|
| Kimi K2.6 | 54.0 |
| Claude Opus 4.6 | 53.0 |
| GPT-5.4 | 52.1 |
這個差距不算大,但方向很清晰:開源模型在頂尖學術推理榜上壓過了兩個閉源旗艦。SWE-Bench Pro 58.6,BrowseComp 83.2,CharXiv(含 Python)86.7,數學視覺推理 93.2。
月之暗面在發布說明中用了「far more execution and imagination」來描述這個版本的提升。
1 兆參數,但只啟動 320 億
這是 MoE 架構的核心邏輯。Kimi K2.6 是一個 1T 參數的 Mixture-of-Experts 模型,每次推理只啟動 32B(320 億)參數。384 個專家分組管理,每次回答調用 8 個路由專家加 1 個共享專家。好處是雙向的:
- 訓練側:總參數量越大,學到的知識越多
- 推理側:啟動參數越少,計算成本越可控
注意力機制採用 MLA(Multi-Head Latent Attention),把處理過的數據壓縮成輕量的數學表示,減少 KV cache 佔用。激活函數是 SwiGLU,比上一代更對硬體友善。視覺模組是單獨的 400M 參數編碼器,支援圖像和多媒體輸入。
上下文視窗 256K,還支援 INT4 量化,本地部署的路子也走通了。
300 個 Agent 並行,12 小時連續運行
這是 Kimi K2.6 真正讓開發者感興趣的部分:
- 最多支援 300 個子 Agent 並行運行
- 單次任務最多 4,000 次以上工具調用
- 持續運行時間可達 12 小時不中斷
為了支援這種規模的多 Agent 協作,月之暗面引入了「Claw Groups」——把大任務拆分成人類與 AI 可協同執行的子組。人在關鍵決策節點介入,AI 負責中間過程的大量執行操作,邏輯上類似工廠流水線的人機分工。
對企業級應用來說這個設計很實際。真實工作流程不是「完全自動化」或「完全人工」二選一,而是需要人在關鍵節點監督,AI 在中間過程大量執行。
開源生態首日就打通了
上線當天就支援了 vLLM、OpenRouter、Cloudflare Workers AI 和 MLX,這背後是提前幾個月就開始的生態對接工作。
- MLX:Apple Silicon 上能跑
- OpenRouter:API 聚合平台直接接入
- vLLM:高吞吐推理部署無障礙
- Cloudflare Workers AI:邊緣推理有了出路
首日完成這些整合不是偶然,說明月之暗面認真做了發布前的工程準備。
開源賽道在認真追了
去年還有人說「開源模型和 GPT-4 有明顯差距」,今年這句話已經說不出口了。
Kimi K2.6 在 HLE 上壓過了 Claude Opus 4.6 和 GPT-5.4。DeepSeek V3.2 把注意力改成稀疏結構,成本砍了一半。Qwen3.6-35B 在 MacBook 上能跑,SWE-bench 73.4%。
開源不再是閉源的低配平替,而是在特定評測維度上反過來領跑了。對企業來說,這意味著私有部署、數據保密、成本控制這些需求終於有了旗艦級的可選方案。
評測成績與生產實戰之間當然還有距離。HLE 的 54.0 和日常的程式碼除錯、長文件理解、多輪對話是兩回事。但方向已經很明確:月之暗面在認真打這場仗,這一局贏了。
參考來源:Moonshot AI releases Kimi-K2.6 model with 1T parameters,CocoLoop、 attention optimizations(SiliconANGLE);[AINews] Moonshot Kimi K2.6: the world's leading Open Model refreshes to catch up to Opus 4.6(Latent Space)