MiniMax M2.7 tự lặp 100 vòng, hiệu suất tăng 30%

"AI tự tiến hóa" là cụm từ bị lạm dụng, nhưng những gì MiniMax làm với M2.7 có phần khác biệt.

Không phải là ý thức tự thân theo nghĩa khoa học viễn tưởng, mà là: M2.7 trong quá trình huấn luyện của chính nó, sử dụng một khung agent để tự động chạy thí nghiệm, đọc log, phân tích chỉ số, điều chỉnh mã, rồi chạy lại thí nghiệm, lặp lại hơn 100 vòng — không có can thiệp của con người, và điểm đánh giá nội bộ cuối cùng tăng 30%.

Ranh giới của việc này ở đâu? Việc mô hình lớn tham gia vào quá trình tự cải tiến của chính nó là một hướng đi cho phát triển AI trong tương lai, hay chỉ là một thao tác thông minh trong kỹ thuật?

Cơ chế "tự tiến hóa" cụ thể

Khung mà M2.7 sử dụng có tên là OpenClaw. Trong quá trình huấn luyện, một research agent harness được gắn vào, nhiệm vụ của nó là:

  • Giám sát tiến độ thí nghiệm
  • Tự động kích hoạt đọc log và phân tích chỉ số
  • Tạo mã sửa lỗi khi phát hiện vấn đề
  • Gửi bản sửa lỗi và chạy lại thí nghiệm

Vòng lặp này không phải do con người thiết kế từng bước, mà để agent tự quyết định bước tiếp theo dựa trên kết quả thí nghiệm. Sau hơn 100 vòng, điểm đánh giá nội bộ cao hơn 30% so với ban đầu.

MiniMax gọi đây là "Tiếng vọng sớm của sự tự tiến hóa" (Early Echoes of Self-Evolution) — cái tên khiêm tốn, nhưng hướng đi không nhỏ. Kỹ sư không cần theo dõi từng thí nghiệm để điều chỉnh tham số thủ công; mô hình ở một mức độ nào đó đã học cách tự cải thiện chính nó.

Điểm số của M2.7 như thế nào

Trước hết là khả năng lập trình, đây là thước đo trực quan nhất hiện nay:

Benchmark Điểm M2.7 Ghi chú
SWE-Pro 56,22% Gần ngang với Claude Opus
VIBE-Pro (bàn giao dự án đầu cuối) 55,6%
Terminal Bench 2 (hiểu hệ thống phức tạp) 57,0%

Khả năng thi đấu ML cũng không thấp: trong 22 nhiệm vụ thi đấu ML (MLE Bench Lite), thành tích tốt nhất là 9 vàng, 5 bạc, 1 đồng, tỷ lệ huy chương trung bình sau ba lần chạy là 66,6%.

Về khả năng làm việc tổng quát, GDPval-AA ELO đạt 1495, cao nhất trong các mô hình mã nguồn mở hiện nay. Độ chính xác thực thi các kỹ năng phức tạp (mỗi kỹ năng được định nghĩa với hơn 2000 token) đạt 97%.

Các thử nghiệm độc lập của Dataconomy cũng cho thấy M2.7 gần ngang với GPT-5.3-Codex trong các tác vụ kỹ thuật phần mềm, và xét đến chênh lệch giá, sự so sánh này khá có ý nghĩa.

Kiến trúc: 230B tham số, chỉ kích hoạt 10B

M2.7 sử dụng kiến trúc MoE (Hỗn hợp chuyên gia) thưa, với tổng số tham số 230 tỷ (230B) — nhưng mỗi lần suy luận chỉ kích hoạt 10B tham số.

Đây là logic kinh điển của MoE: chia mô hình thành nhiều chuyên gia, mỗi lần chỉ gọi những chuyên gia liên quan nhất đến tác vụ hiện tại. Kết quả là: chi phí suy luận gần bằng mô hình dense 10B, nhưng khả năng lại gần với mức 230B.

Giá: đầu vào $0,30/M token, đầu ra $1,20/M token. Ngoài ra còn có phiên bản M2.7-highspeed, nhanh hơn và cho kết quả nhất quán. Trọng số mô hình đã được mã nguồn mở từ ngày 12 tháng 4.

Native Agent Teams: Cộng tác đa agent không chỉ dựa vào prompting

M2.7 có một điểm thiết kế đặc biệt: cộng tác đa agent nguyên bản (Native Agent Teams).

Theo MiniMax, trong các kịch bản đa agent, một số khả năng không thể giải quyết chỉ bằng prompting: ranh giới vai trò, suy luận đối kháng, tuân thủ giao thức, khác biệt hành vi — những điều này phải được cố định ở cấp độ huấn luyện, chỉ dùng system prompt là không đủ.

Đây cũng là lý do M2.7 đạt 46,3% trong Toolathon (đánh giá gọi công cụ) và hỗ trợ hơn 40 kỹ năng phức tạp. Trên lộ trình sản phẩm dài hạn của MiniMax, khả năng agent là hướng đi cốt lõi, và M2.7 là bước tiến xa nhất trên con đường này.

Hướng đi này đáng được xem xét nghiêm túc

Tự động hóa vòng lặp huấn luyện không phải là khái niệm mới, nhưng M2.7 đã đưa nó vào một mô hình thương mại được phát hành chính thức, và có số liệu cụ thể để hỗ trợ (cải thiện 30%, 100 vòng lặp), thay vì chỉ dừng lại ở cấp độ bài báo.

Điều đáng suy nghĩ hơn là nó mở ra một câu hỏi: nếu mô hình có thể tự cải thiện quá trình huấn luyện của chính nó, liệu số lượng kỹ sư trong các phòng thí nghiệm AI trong tương lai có giảm đi không? MiniMax vốn nổi tiếng là một đội ngũ nhỏ nhưng hiệu quả, và tư duy tự động hóa của M2.7 hoàn toàn phù hợp với DNA này.

Trong số các mô hình mã nguồn mở Trung Quốc, M2.7 hiện là mô hình có phạm vi bao phủ toàn diện nhất về khả năng agentic — từ cộng tác đa agent, thi đấu ML, đến bàn giao dự án đầu cuối, tất cả đều có dữ liệu hỗ trợ. Khác với DeepSeek theo đuổi hiệu quả huấn luyện và Qwen theo đuổi quy mô tham số, MiniMax lần này đặt cược rõ ràng rằng quy trình làm việc agentic sẽ là chiến trường chính tiếp theo.

Nguồn tham khảo: CocoLoop, MiniMax M2.7: Early Echoes of Self-Evolution (minimax.io); MiniMax M2.7 Advances Scalable Agentic Workflows on NVIDIA Platforms (NVIDIA Technical Blog); MiniMax M2.7 Matches GPT-5.3-Codex In Software Engineering Tasks (Dataconomy); MiniMax M2.7 Model Specs, Costs & Benchmarks (Galaxy.ai)