「AI 自我進化」這個詞已經被說爛了,但 MiniMax 在 M2.7 上做的事情稍微不一樣。
不是科幻意義上的自我意識,而是:M2.7 在自己的訓練過程裡,用一套代理框架自動跑實驗、讀日誌、分析指標、調整程式碼、再跑實驗,循環 100 多輪——沒有人工干預,內部評測指標最終漲了 30%。
這件事的邊界在哪裡?大型語言模型參與自身迭代,是未來 AI 開發的一個方向,還是只是工程上的一次聰明操作?
「自我進化」的具體機制
M2.7 使用的框架叫 OpenClaw。訓練過程裡掛了一個研究代理 harness,它的工作是:
- 監控實驗進度
- 自動觸發日誌讀取和指標分析
- 發現問題後生成修復程式碼
- 提交修復,重新執行實驗
這個循環不是人設計每一步,而是讓代理自己根據實驗結果決定下一步做什麼。跑了 100 多輪之後,內部評測比原來高出 30%。
MiniMax 把這稱為「早期自我進化的回聲」(Early Echoes of Self-Evolution)——名字謙虛,但方向不小。工程師不需要盯著每次實驗手動調整參數,模型在某種程度上學會了把自己調得更好。
M2.7 跑分怎麼樣
先看程式設計能力,這是目前最直觀的橫向評測維度:
| 基準測試 | M2.7 得分 | 說明 |
|---|---|---|
| SWE-Pro | 56.22% | 接近 Claude Opus 水準 |
| VIBE-Pro(端到端專案交付) | 55.6% | — |
| Terminal Bench 2(複雜系統理解) | 57.0% | — |
ML 競賽能力也不低:在 22 個 ML 競賽任務(MLE Bench Lite)裡,最佳成績是 9 金 5 銀 1 銅,三次執行平均獎牌率 66.6%。
通用工作能力方面,GDPval-AA ELO 1495,是開源模型裡目前最高的。複雜技能(每個技能 2000+ 代幣定義)執行準確率達到 97%。
Dataconomy 的獨立測試也顯示,M2.7 在軟體工程任務上接近 GPT-5.3-Codex 的水準,考慮到價格差距,這個對比挺有意義的。
架構:230B 參數,只啟動 10B
M2.7 是稀疏 MoE(混合專家)架構,總參數 2300 億(230B)——但每次推理只啟動 10B 參數。
這是 MoE 的經典邏輯:把模型切成很多個專家,每次只呼叫對當前任務最相關的那幾個。效果是:推理成本接近 10B 密集模型,能力卻接近 230B 的量級。
價格:輸入 $0.30/M 代幣,輸出 $1.20/M 代幣。另有 M2.7-highspeed 版本,速度更快,結果一致。模型權重已於 4 月 12 日開源。
原生代理團隊:多代理協作不是靠提示工程
M2.7 有個專門設計點:原生多代理協作(Native Agent Teams)。
MiniMax 的說法是,多代理場景裡有些能力不能靠提示工程解決:角色邊界、對抗性推理、協定遵守、行為差異——這些必須在訓練層面固化進去,光靠系統提示詞撐不住。
這也是 M2.7 在 Toolathon(工具呼叫評測)拿到 46.3%、支援 40+ 複雜技能的原因。在 MiniMax 的長期產品路線上,代理能力是核心方向,M2.7 是這條路上走得最遠的一步。
這個方向值得認真對待
自動化訓練迭代不是新概念,但 M2.7 把它做進了一個正式發布的商業模型,並且有具體數字支撐(30% 提升,100 輪迭代),而不是只停留在論文層面。
更值得想的是它打開了一個問題:如果模型能自己改進自己的訓練過程,未來 AI 實驗室的工程師數量會不會變少?MiniMax 本來就是以小規模高效著稱的團隊,M2.7 的自動化思路和這個基因完全一致。
國產開源模型裡,M2.7 是目前在代理能力上覆蓋最全的——從多代理協作、ML 競賽、到端到端專案交付都有數據支撐。跟 DeepSeek 走訓練效率路線、Qwen 走參數規模路線不同,MiniMax 這次明確在賭代理工作流程是下一個主戰場。
參考來源:CocoLoop、MiniMax M2.7: Early Echoes of Self-Evolution(minimax.io);MiniMax M2.7 Advances Scalable Agentic Workflows on NVIDIA Platforms(NVIDIA Technical Blog);MiniMax M2.7 Matches GPT-5.3-Codex In Software Engineering Tasks(Dataconomy);MiniMax M2.7 Model Specs, Costs & Benchmarks(Galaxy.ai)