MiniMax âm thầm ra mắt bản xem trước M3.1-Flash

Ngày 27 tháng 9, MiniMax đã đưa mô hình văn bản mới M3.1-Flash-Preview lên công cụ lập trình MiniMax Code của chính mình. Theo định vị chính thức, mô hình này phục vụ công việc phát triển hàng ngày, từ sửa lỗi nhỏ đến xây dựng tính năng hoàn chỉnh. Cùng ngày, MiniMax đã đặt lại hạn mức Token Plan cho toàn bộ người dùng và phát thêm thẻ reset hạn mức; từ 28/9 đến 7/10, điểm điểm danh trên MiniMax Code được nhân đôi, áp dụng cho cả người dùng mới lẫn cũ, điểm có thể dùng cho mọi mô hình.

Hiện tại, mô hình này chỉ có thể tiếp cận qua hai kênh: gói đăng ký Token Plan, và MiniMax Code. API công khai trả theo lượng dùng vẫn chưa mở.

Những gì tài liệu đã xác nhận

Tài liệu tích hợp của nền tảng mở MiniMax đã có mục riêng cho mô hình này, với các thông số được xác nhận gồm:

  • Cửa sổ ngữ cảnh 1 triệu token, hướng tới tài liệu dài, toàn bộ codebase và các phiên làm việc agent nhiều bước;
  • Tốc độ xuất ra được công bố trên 100 token mỗi giây;
  • Đầu vào hỗ trợ văn bản, hình ảnh và video;
  • Tham số effort điều chỉnh độ sâu suy luận, chia thành 5 mức low, medium, high, xhigh, max — nếu không khai báo thì mặc định là max.

Có một giới hạn được ghi rõ: khả năng suy luận của mô hình này không thể tắt. Nếu gọi API mà cố tắt reasoning, hệ thống sẽ trả thẳng lỗi 400; tài liệu khuyên nếu muốn giảm độ trễ thì hạ mức effort xuống. Về cách tích hợp, MiniMax cung cấp cả hai kiểu endpoint theo phong cách Anthropic và OpenAI, trong đó kiểu đầu được đánh dấu là khuyến nghị.

Phần chưa được công bố

Lần ra mắt này khá âm thầm. Một số cơ quan truyền thông công nghệ nhận thấy MiniMax không phát thông cáo chính thức, cũng không có model card, báo cáo đánh giá hay bảng giá. Bảng xếp hạng bên thứ ba BenchLM tính đến 27/9 vẫn ghi nhận 0 kết quả benchmark cho mô hình này.

Cơ quan truyền thông đó còn nhắc tới một kho lưu trữ giới hạn quyền truy cập trên Hugging Face có tên MiniMax-M3.1-preview-private, dung lượng khoảng 250GB, người ngoài không thể tải về. Đây có phải là trọng số của bản Flash preview hay không, và liệu sau này có được mở mã nguồn như M3 hay không, MiniMax hiện chưa phản hồi. Mỗi mức trong 5 mức effort tiêu tốn bao nhiêu tài nguyên tính toán và chênh lệch độ trễ ra sao, tài liệu cũng không đưa ra con số.

So với M3, nhịp độ ra mắt đã đổi khác

M3 ra mắt ngày 1/6 đi theo hướng khác: trọng số mã nguồn mở, ngữ cảnh 1 triệu token, đa phương thức gốc — tất cả được công bố cùng lúc, kèm theo kiến trúc attention thưa tự phát triển MSA và trọn bộ điểm benchmark lập trình, với SWE-Bench Pro đạt 59,0% và Terminal-Bench 2.1 đạt 66,0%. Lần đó MiniMax lấy "ngữ cảnh triệu token với giá phải chăng" làm điểm bán chính, số liệu đưa ra rất đầy đủ.

M3.1-Flash-Preview lại đi theo hướng sản phẩm trước, tư liệu sau: để người dùng trả phí dùng thử trong MiniMax Code trước, đồng thời dùng việc reset hạn mức và hoạt động điểm danh để kéo người dùng quay lại. Cái tên Flash và Preview cũng nói lên vị trí của nó — một bên là hạng nhẹ hướng tới tốc độ, một bên là chưa định hình xong.

Nhịp độ này gần đây khá phổ biến trong giới mô hình lập trình nội địa Trung Quốc. MiMo-V2.6 của Xiaomi tách thành hai hạng Pro và Flash, trong đó Flash đi theo hướng hiệu quả; DeepSeek v4.1 Flash dựa vào hạn mức tặng từ công cụ lập trình nước ngoài OpenCode để mở rộng người dùng; Zhipu cũng có GLM-5.3-Flash. Người dùng công cụ lập trình nhạy cảm nhất với giá và tốc độ phản hồi, nên việc tung hạng nhẹ trước rồi bổ sung điểm benchmark sau giúp thu về phản hồi sử dụng thực tế nhanh hơn.

Với các nhà phát triển tại Trung Quốc, muốn thử mô hình này ngay lúc này thì cần có gói Token Plan hoặc dùng trực tiếp MiniMax Code. Effort mặc định ở mức cao nhất, nếu chỉ sửa lỗi nhỏ thì hạ xuống một hai mức sẽ phản hồi nhanh hơn và tiết kiệm hạn mức hơn. Còn việc nó nhanh hơn M3 bao nhiêu, viết code có giảm chất lượng hay không, thì phải chờ MiniMax công bố đánh giá, hoặc bên thứ ba chạy benchmark mới biết được.

Nguồn tham khảo: tài khoản mạng xã hội chính thức của MiniMax, tài liệu tích hợp nền tảng mở MiniMax, AlphaSignal, CocoLoop, BenchLM; độ dài ngữ cảnh, các mức effort và giới hạn tích hợp được kiểm chứng theo tài liệu của MiniMax, điểm benchmark của M3 do hãng tự công bố.