MiniMax는 9월 27일 자사 코딩 제품인 MiniMax Code에 새로운 텍스트 모델 M3.1-Flash-Preview를 올렸다. 공식적으로는 일상적인 개발 작업, 즉 작은 버그 수정부터 전체 기능 구현까지를 겨냥한 모델이라고 밝혔다. 같은 날 MiniMax는 전체 사용자의 Token Plan 사용량을 초기화하고 별도의 초기화 카드도 지급했다. 9월 28일부터 10월 7일까지는 MiniMax Code의 출석 포인트가 두 배로 늘어나며, 신규·기존 사용자 모두 참여할 수 있고 포인트는 모든 모델에서 공통으로 쓸 수 있다.
현재 이 모델에 접근할 수 있는 경로는 두 가지뿐이다. Token Plan 구독, 아니면 MiniMax Code 자체다. 종량제 방식의 공개 API는 아직 열리지 않았다.
문서에서 확인되는 부분
MiniMax 오픈 플랫폼 연동 문서에는 이미 이 모델의 항목이 올라와 있으며, 다음과 같은 사양을 확인할 수 있다.
- 100만 토큰 컨텍스트를 지원하며, 긴 문서와 코드베이스 전체, 다단계 에이전트 세션을 겨냥한다.
- 초당 100토큰 이상이라는 출력 속도를 표방한다.
- 입력은 텍스트, 이미지, 동영상을 지원한다.
- "effort" 파라미터로 추론 깊이를 low, medium, high, xhigh, max 다섯 단계로 조절할 수 있으며, 지정하지 않으면 기본값은 max다.
명확히 적힌 제한 사항도 하나 있다. 이 모델은 추론을 끌 수 없다. 호출할 때 추론을 비활성화하려고 하면 API는 그대로 400 오류를 반환하며, 지연 시간을 줄이고 싶다면 effort를 낮추라고 문서는 안내한다. 연동 방식으로는 Anthropic 방식과 OpenAI 방식 두 가지 엔드포인트가 제공되며, 전자가 권장으로 표시돼 있다.
공개되지 않은 부분
이번 출시는 상당히 조용했다. 한 테크 매체는 MiniMax가 공식 발표를 내지 않았고 모델 카드, 평가 보고서, 가격 정보도 전혀 공개하지 않았다고 지적했다. 서드파티 리더보드 BenchLM에는 9월 27일 기준으로 이 모델의 벤치마크 결과가 하나도 등록되지 않았다.
같은 매체는 Hugging Face에 MiniMax-M3.1-preview-private라는 이름의 비공개 저장소가 있으며, 용량은 약 250GB로 외부에서는 내려받을 수 없다는 점도 언급했다. 이것이 Flash 프리뷰의 가중치인지, 앞으로 M3처럼 오픈소스로 공개될지에 대해 MiniMax는 아직 답하지 않았다. 다섯 단계의 effort가 각각 얼마나 많은 연산을 소모하는지, 지연 시간 차이가 얼마나 되는지도 문서에는 수치로 나와 있지 않다.
M3와는 다른 출시 리듬
6월 1일 출시된 M3는 다른 전략을 썼다. 오픈 가중치, 100만 토큰 컨텍스트, 네이티브 멀티모달을 한꺼번에 내놓았고, 자체 개발한 희소 어텐션 구조 MSA와 코딩 벤치마크 전체를 함께 공개했다. SWE-Bench Pro에서 59.0%, Terminal-Bench 2.1에서 66.0%라는 수치를 보고했다. 당시 MiniMax는 "부담 없는 가격의 100만 토큰 컨텍스트"를 핵심 세일즈 포인트로 내세우며 숫자를 아낌없이 공개했다.
M3.1-Flash-Preview가 택한 방식은 제품을 먼저 내놓고 자료는 나중에 채우는 쪽이다. 유료 사용자가 먼저 MiniMax Code에서 써보게 하면서, 사용량 초기화와 출석 이벤트로 사용자를 다시 끌어들인다. 이름에 들어간 "Flash"와 "Preview"도 이 모델의 위치를 보여준다. 하나는 속도를 앞세운 경량 등급, 다른 하나는 아직 형태가 확정되지 않았다는 뜻이다.
이런 흐름은 최근 중국 코딩 모델 사이에서 흔히 보인다. 샤오미(Xiaomi)의 MiMo-V2.6은 Pro와 Flash로 나뉘며 Flash는 효율성 노선을 택했다. DeepSeek v4.1 Flash는 해외 코딩 도구 OpenCode가 나눠주는 무료 사용량을 통해 퍼지고 있고, Zhipu AI에도 GLM-5.3-Flash가 있다. 코딩 도구 사용자는 가격과 응답 속도에 가장 민감하기 때문에, 경량 등급을 먼저 내놓고 벤치마크는 나중에 채우는 편이 실제 사용 피드백을 더 빨리 얻는 방법이다.
중국 개발자가 지금 이 모델을 써보려면 Token Plan 구독이 있거나 MiniMax Code를 직접 이용해야 한다. effort 기본값은 최고 단계이므로, 단순한 버그 수정 정도라면 한두 단계 낮추는 편이 응답 속도도 빠르고 사용량도 아낄 수 있다. M3보다 얼마나 빠른지, 코드 품질이 떨어지지는 않는지는 MiniMax의 자체 평가 결과나 서드파티 벤치마크가 나와야 알 수 있다.
참고 출처: MiniMax 공식 소셜미디어 계정, MiniMax 오픈 플랫폼 연동 문서, AlphaSignal, CocoLoop, BenchLM. 컨텍스트 길이, effort 단계, 연동 제한 사항은 MiniMax 문서를 기준으로 확인했으며, M3 벤치마크 수치는 제조사가 자체 발표한 값이다.