「AIの自己進化」という言葉は使い古されているが、MiniMaxがM2.7で行ったことは少し異なる。
SF的な自己意識ではない。M2.7は自身のトレーニングプロセスにおいて、エージェントフレームワークを使って実験の自動実行、ログの読み取り、指標の分析、コードの修正、実験の再実行を、100ラウンド以上にわたって繰り返した——人間の介入は一切なく、内部評価指標は最終的に30%向上した。
この取り組みの限界はどこにあるのか。大規模モデルが自身の反復に参加することは、将来のAI開発の方向性なのか、それとも単に工学的に賢い操作なのか。
「自己進化」の具体的なメカニズム
M2.7が使用するフレームワークはOpenClawと呼ばれる。トレーニングプロセスには研究用エージェントハーネスが組み込まれており、その役割は以下の通り:
- 実験の進捗を監視
- ログの読み取りと指標分析を自動的にトリガー
- 問題を特定した後に修正コードを生成
- 修正を提出し、実験を再実行
このループは人間が各ステップを設計するのではなく、エージェントが実験結果に基づいて次のアクションを決定する。100ラウンド以上実行した後、内部ベンチマークは元のものより30%高くなった。
MiniMaxはこれを「初期の自己進化のこだま」(Early Echoes of Self-Evolution)と呼んでいる——控えめな名前だが、方向性は大きい。エンジニアは各実験を監視して手動でパラメータを調整する必要がなくなり、モデルはある程度、自分自身をより良く調整することを学習した。
M2.7のスコアはどうか
まずプログラミング能力。これは現在最も直感的な横断的評価軸である:
| ベンチマーク | M2.7スコア | 備考 |
|---|---|---|
| SWE-Pro | 56.22% | Claude Opusの水準に近い |
| VIBE-Pro(エンドツーエンドプロジェクト納品) | 55.6% | — |
| Terminal Bench 2(複雑システム理解) | 57.0% | — |
MLコンペティション能力も高い。22のMLコンペティションタスク(MLE Bench Lite)において、最高成績は金9、銀5、銅1で、3回の実行における平均メダル率は66.6%である。
一般的な作業能力については、GDPval-AA ELOが1495で、これは現在オープンソースモデルの中で最高である。複雑なスキル(各スキルは2000+トークンで定義)の実行精度は97%に達する。
Dataconomyの独立したテストでも、M2.7はソフトウェアエンジニアリングタスクにおいてGPT-5.3-Codexの水準に近づいていることが示されている。価格差を考慮すると、この比較は非常に意味がある。
アーキテクチャ:230Bパラメータ、活性化されるのは10Bのみ
M2.7はスパースMoE(混合エキスパート)アーキテクチャを採用し、総パラメータ数は2300億(230B)——だが、推論ごとに活性化されるのはわずか10Bパラメータである。
これはMoEの古典的なロジックである。モデルを多数のエキスパートに分割し、各タスクに最も関連するものだけを呼び出す。効果としては、推論コストは10Bの高密度モデルに近く、能力は230Bの規模に迫る。
価格:入力$0.30/Mトークン、出力$1.20/Mトークン。M2.7-highspeedバージョンもあり、より高速で結果は一貫している。モデルの重みは4月12日にオープンソース化された。
ネイティブエージェントチーム:プロンプティングに頼らないマルチエージェント協調
M2.7には特別な設計ポイントがある:ネイティブマルチエージェント協調(Native Agent Teams)である。
MiniMaxの説明によれば、マルチエージェントシナリオでは、プロンプティングだけでは解決できない能力がある:役割の境界、敵対的推論、プロトコルの遵守、行動の差異——これらはトレーニングレベルで固定化される必要があり、システムプロンプトだけでは支えきれない。
これが、M2.7がToolathon(ツール呼び出し評価)で46.3%を達成し、40以上の複雑なスキルをサポートする理由でもある。MiniMaxの長期的な製品ロードマップにおいて、エージェント能力は中核的な方向性であり、M2.7はこの道で最も遠くまで進んだ一歩である。
この方向性は真剣に検討する価値がある
自動化されたトレーニング反復は新しい概念ではないが、M2.7はそれを正式にリリースされた商用モデルに実装し、具体的な数字(30%の向上、100ラウンドの反復)で裏付けており、論文のレベルに留まっていない。
さらに考えさせられるのは、それが開く問いである:もしモデルが自身のトレーニングプロセスを改善できるなら、将来AIラボのエンジニアの数は減るのだろうか?MiniMaxはもともと小規模で高効率なチームとして知られており、M2.7の自動化アプローチはこのDNAと完全に一致している。
中国のオープンソースモデルの中で、M2.7は現在、エージェント能力において最も包括的なカバレッジを持つ——マルチエージェント協調、MLコンペティション、エンドツーエンドプロジェクト納品のすべてにおいてデータで裏付けられている。DeepSeekがトレーニング効率の路線を、Qwenがパラメータ規模の路線を追求するのとは異なり、MiniMaxは今回、エージェントワークフローが次の主戦場であると明確に賭けている。
出典:CocoLoop、MiniMax M2.7: Early Echoes of Self-Evolution(minimax.io);MiniMax M2.7 Advances Scalable Agentic Workflows on NVIDIA Platforms(NVIDIA Technical Blog);MiniMax M2.7 Matches GPT-5.3-Codex In Software Engineering Tasks(Dataconomy);MiniMax M2.7 Model Specs, Costs & Benchmarks(Galaxy.ai)