Kimi K2.6 拿下 HLE 開源第一

月之暗面上週把 Kimi K2.6 完整版推出來了,這不是什麼「程式碼預覽」測試版,而是完整的生產級模型。之前的 Code Preview 已經引發一波關注,但完整版的技術規格與跑分結果出爐後,情況比許多人預期的更有意思。

HLE-Full 54.0,開源第一是真的拿到了

HLE(Humanity's Last Exam)是今年 AI 評測中含金量最高的榜單之一,2,500 道博士級別的題目橫跨 100 多個學術領域,不是那種靠 few-shot 就能矇混過關的測試。

Kimi K2.6 的成績:

模型HLE-Full(含工具)
Kimi K2.654.0
Claude Opus 4.653.0
GPT-5.452.1

這個差距不算大,但方向很清晰:開源模型在頂尖學術推理榜上壓過了兩個閉源旗艦。SWE-Bench Pro 58.6,BrowseComp 83.2,CharXiv(含 Python)86.7,數學視覺推理 93.2。

月之暗面在發布說明中用了「far more execution and imagination」來描述這個版本的提升。

1 兆參數,但只啟動 320 億

這是 MoE 架構的核心邏輯。Kimi K2.6 是一個 1T 參數的 Mixture-of-Experts 模型,每次推理只啟動 32B(320 億)參數。384 個專家分組管理,每次回答調用 8 個路由專家加 1 個共享專家。好處是雙向的:

  • 訓練側:總參數量越大,學到的知識越多
  • 推理側:啟動參數越少,計算成本越可控

注意力機制採用 MLA(Multi-Head Latent Attention),把處理過的數據壓縮成輕量的數學表示,減少 KV cache 佔用。激活函數是 SwiGLU,比上一代更對硬體友善。視覺模組是單獨的 400M 參數編碼器,支援圖像和多媒體輸入。

上下文視窗 256K,還支援 INT4 量化,本地部署的路子也走通了。

300 個 Agent 並行,12 小時連續運行

這是 Kimi K2.6 真正讓開發者感興趣的部分:

  • 最多支援 300 個子 Agent 並行運行
  • 單次任務最多 4,000 次以上工具調用
  • 持續運行時間可達 12 小時不中斷

為了支援這種規模的多 Agent 協作,月之暗面引入了「Claw Groups」——把大任務拆分成人類與 AI 可協同執行的子組。人在關鍵決策節點介入,AI 負責中間過程的大量執行操作,邏輯上類似工廠流水線的人機分工。

對企業級應用來說這個設計很實際。真實工作流程不是「完全自動化」或「完全人工」二選一,而是需要人在關鍵節點監督,AI 在中間過程大量執行。

開源生態首日就打通了

上線當天就支援了 vLLM、OpenRouter、Cloudflare Workers AI 和 MLX,這背後是提前幾個月就開始的生態對接工作。

  • MLX:Apple Silicon 上能跑
  • OpenRouter:API 聚合平台直接接入
  • vLLM:高吞吐推理部署無障礙
  • Cloudflare Workers AI:邊緣推理有了出路

首日完成這些整合不是偶然,說明月之暗面認真做了發布前的工程準備。

開源賽道在認真追了

去年還有人說「開源模型和 GPT-4 有明顯差距」,今年這句話已經說不出口了。

Kimi K2.6 在 HLE 上壓過了 Claude Opus 4.6 和 GPT-5.4。DeepSeek V3.2 把注意力改成稀疏結構,成本砍了一半。Qwen3.6-35B 在 MacBook 上能跑,SWE-bench 73.4%。

開源不再是閉源的低配平替,而是在特定評測維度上反過來領跑了。對企業來說,這意味著私有部署、數據保密、成本控制這些需求終於有了旗艦級的可選方案。

評測成績與生產實戰之間當然還有距離。HLE 的 54.0 和日常的程式碼除錯、長文件理解、多輪對話是兩回事。但方向已經很明確:月之暗面在認真打這場仗,這一局贏了。

參考來源:Moonshot AI releases Kimi-K2.6 model with 1T parameters,CocoLoop、 attention optimizations(SiliconANGLE);[AINews] Moonshot Kimi K2.6: the world's leading Open Model refreshes to catch up to Opus 4.6(Latent Space)