Em 27 de setembro, a MiniMax lançou o novo modelo de texto M3.1-Flash-Preview em sua própria ferramenta de programação, o MiniMax Code. Segundo o posicionamento oficial, o modelo é voltado ao desenvolvimento do dia a dia, desde a correção de pequenos bugs até a criação de funcionalidades completas. No mesmo dia, a MiniMax reiniciou as cotas do Token Plan para todos os usuários e emitiu cartões extras de reset; de 28 de setembro a 7 de outubro, os pontos de check-in no MiniMax Code foram dobrados, valendo tanto para usuários novos quanto antigos, e podem ser usados em qualquer modelo.
No momento, o modelo só pode ser acessado por dois canais: a assinatura Token Plan e o MiniMax Code. A API pública paga por uso ainda não foi aberta.
O que a documentação confirma
A documentação de integração da plataforma aberta da MiniMax já traz uma entrada para este modelo, com as seguintes especificações confirmadas:
- Contexto de 1 milhão de tokens, voltado a documentos longos, bases de código inteiras e sessões de agentes com múltiplas etapas;
- Velocidade de saída nominal de mais de 100 tokens por segundo;
- Entrada com suporte a texto, imagem e vídeo;
- O parâmetro
effortajusta a profundidade de raciocínio em cinco níveis: low, medium, high, xhigh, max — se não for especificado, o padrão é max.
Há uma limitação claramente descrita: o raciocínio deste modelo não pode ser desativado. Se a chamada tentar desligar o reasoning, a API retorna diretamente um erro 400; a documentação recomenda reduzir o nível de effort para quem quer menos latência. Quanto à integração, a MiniMax oferece endpoints nos estilos Anthropic e OpenAI, com o primeiro marcado como recomendado.
O que não foi divulgado
Este lançamento foi bastante discreto. Veículos de tecnologia notaram que a MiniMax não emitiu um comunicado oficial, e não há model card, relatório de avaliação nem preços. O ranking de terceiros BenchLM registrava zero resultados de benchmark para o modelo até 27 de setembro.
O mesmo veículo mencionou ainda um repositório restrito no Hugging Face chamado MiniMax-M3.1-preview-private, com cerca de 250 GB, que pessoas de fora não conseguem baixar. Se são esses os pesos da versão Flash preview, e se ela será aberta futuramente como o M3, a MiniMax ainda não respondeu. Quanto ao consumo de computação de cada um dos cinco níveis de effort e à diferença de latência entre eles, a documentação também não traz números.
Comparado ao M3, um ritmo de lançamento diferente
O M3, lançado em 1º de junho, seguiu outra abordagem: pesos abertos, contexto de 1 milhão de tokens e multimodalidade nativa foram divulgados juntos, acompanhados da arquitetura de atenção esparsa desenvolvida internamente, a MSA, e um conjunto completo de benchmarks de programação — o SWE-Bench Pro registrou 59,0% e o Terminal-Bench 2.1, 66,0%. Naquela ocasião, a MiniMax fez do "contexto de um milhão de tokens acessível" seu principal argumento de venda, com bastante dados.
O M3.1-Flash-Preview segue o caminho inverso: produto primeiro, documentação depois. Os usuários pagantes são convidados a experimentá-lo no MiniMax Code, enquanto o reset de cotas e as campanhas de check-in trazem as pessoas de volta. Os nomes Flash e Preview também indicam sua posição — um lado leve voltado à velocidade, o outro ainda não finalizado.
Esse ritmo tem se tornado comum entre os modelos de programação chineses recentemente. O MiMo-V2.6 da Xiaomi se divide em Pro e Flash, com o Flash seguindo o caminho da eficiência; o DeepSeek v4.1 Flash conquista usuários por meio de cotas gratuitas da ferramenta estrangeira de programação OpenCode; a Zhipu também tem o GLM-5.3-Flash. Usuários de ferramentas de programação são os mais sensíveis a preço e velocidade de resposta, então lançar primeiro a versão leve e completar os benchmarks depois permite obter feedback real de uso mais rapidamente.
Para desenvolvedores chineses que queiram testar o modelo agora, é preciso ter uma assinatura Token Plan ou usar diretamente o MiniMax Code. O effort vem por padrão no nível mais alto; para quem só corrige pequenos bugs, reduzir um ou dois níveis traz respostas mais rápidas e economiza cota. Já o quanto ele é mais rápido que o M3 e se a qualidade do código cai, isso só será possível saber quando a MiniMax divulgar suas avaliações ou terceiros rodarem os benchmarks.
Fontes: contas oficiais da MiniMax em redes sociais, documentação de integração da plataforma aberta da MiniMax, AlphaSignal, CocoLoop, BenchLM; comprimento de contexto, níveis de effort e limites de integração verificados conforme a documentação da MiniMax; os benchmarks do M3 são autodeclarados pelo fabricante.