MiniMax M2.7 自我迭代 100 輪,效能提升 30%

「AI 自我進化」這個詞已經被說爛了,但 MiniMax 在 M2.7 上做的事情稍微不一樣。

不是科幻意義上的自我意識,而是:M2.7 在自己的訓練過程裡,用一套代理框架自動跑實驗、讀日誌、分析指標、調整程式碼、再跑實驗,循環 100 多輪——沒有人工干預,內部評測指標最終漲了 30%

這件事的邊界在哪裡?大型語言模型參與自身迭代,是未來 AI 開發的一個方向,還是只是工程上的一次聰明操作?

「自我進化」的具體機制

M2.7 使用的框架叫 OpenClaw。訓練過程裡掛了一個研究代理 harness,它的工作是:

  • 監控實驗進度
  • 自動觸發日誌讀取和指標分析
  • 發現問題後生成修復程式碼
  • 提交修復,重新執行實驗

這個循環不是人設計每一步,而是讓代理自己根據實驗結果決定下一步做什麼。跑了 100 多輪之後,內部評測比原來高出 30%。

MiniMax 把這稱為「早期自我進化的回聲」(Early Echoes of Self-Evolution)——名字謙虛,但方向不小。工程師不需要盯著每次實驗手動調整參數,模型在某種程度上學會了把自己調得更好。

M2.7 跑分怎麼樣

先看程式設計能力,這是目前最直觀的橫向評測維度:

基準測試M2.7 得分說明
SWE-Pro56.22%接近 Claude Opus 水準
VIBE-Pro(端到端專案交付)55.6%
Terminal Bench 2(複雜系統理解)57.0%

ML 競賽能力也不低:在 22 個 ML 競賽任務(MLE Bench Lite)裡,最佳成績是 9 金 5 銀 1 銅,三次執行平均獎牌率 66.6%

通用工作能力方面,GDPval-AA ELO 1495,是開源模型裡目前最高的。複雜技能(每個技能 2000+ 代幣定義)執行準確率達到 97%

Dataconomy 的獨立測試也顯示,M2.7 在軟體工程任務上接近 GPT-5.3-Codex 的水準,考慮到價格差距,這個對比挺有意義的。

架構:230B 參數,只啟動 10B

M2.7 是稀疏 MoE(混合專家)架構,總參數 2300 億(230B)——但每次推理只啟動 10B 參數。

這是 MoE 的經典邏輯:把模型切成很多個專家,每次只呼叫對當前任務最相關的那幾個。效果是:推理成本接近 10B 密集模型,能力卻接近 230B 的量級。

價格:輸入 $0.30/M 代幣,輸出 $1.20/M 代幣。另有 M2.7-highspeed 版本,速度更快,結果一致。模型權重已於 4 月 12 日開源。

原生代理團隊:多代理協作不是靠提示工程

M2.7 有個專門設計點:原生多代理協作(Native Agent Teams)。

MiniMax 的說法是,多代理場景裡有些能力不能靠提示工程解決:角色邊界、對抗性推理、協定遵守、行為差異——這些必須在訓練層面固化進去,光靠系統提示詞撐不住。

這也是 M2.7 在 Toolathon(工具呼叫評測)拿到 46.3%、支援 40+ 複雜技能的原因。在 MiniMax 的長期產品路線上,代理能力是核心方向,M2.7 是這條路上走得最遠的一步。

這個方向值得認真對待

自動化訓練迭代不是新概念,但 M2.7 把它做進了一個正式發布的商業模型,並且有具體數字支撐(30% 提升,100 輪迭代),而不是只停留在論文層面。

更值得想的是它打開了一個問題:如果模型能自己改進自己的訓練過程,未來 AI 實驗室的工程師數量會不會變少?MiniMax 本來就是以小規模高效著稱的團隊,M2.7 的自動化思路和這個基因完全一致。

國產開源模型裡,M2.7 是目前在代理能力上覆蓋最全的——從多代理協作、ML 競賽、到端到端專案交付都有數據支撐。跟 DeepSeek 走訓練效率路線、Qwen 走參數規模路線不同,MiniMax 這次明確在賭代理工作流程是下一個主戰場。

參考來源:CocoLoop、MiniMax M2.7: Early Echoes of Self-Evolution(minimax.io);MiniMax M2.7 Advances Scalable Agentic Workflows on NVIDIA Platforms(NVIDIA Technical Blog);MiniMax M2.7 Matches GPT-5.3-Codex In Software Engineering Tasks(Dataconomy);MiniMax M2.7 Model Specs, Costs & Benchmarks(Galaxy.ai)