Em 13 de abril, a Moonshot AI disponibilizou a prévia do código K2.6 para todos os assinantes do Kimi Code. Esta versão foi lançada amplamente após cerca de uma semana de testes fechados, menos de duas semanas após o lançamento do GPT-5.4-Cyber e do Anthropic Mythos.
A Moonshot não fez uma coletiva de imprensa, nem um longo post no blog. Um e-mail, e seu Kimi Code foi atualizado.
Em comparação com o K2.5, o K2.6 oferece três melhorias principais: cadeias de raciocínio mais profundas, planos de Agente de várias etapas mais claros e execução de chamadas de ferramentas mais confiável. O efeito prático é visto em: ao fazer grandes refatorações em vários arquivos ou decompor fluxos de trabalho complexos de Agentes, a taxa de erros diminui e a lógica fica mais coerente.
O preço é a verdadeira vantagem
Antes mesmo dos benchmarks serem divulgados, os preços já causaram impacto.
| Modelo | Entrada (por milhão de tokens) | Saída (por milhão de tokens) |
|---|---|---|
| Kimi K2.6 | $0,60 | $2,50 |
| Claude Sonnet 4.6 | $3,00 | $15,00 |
| GPT-5.4 | $2,50 | $10,00 |
A entrada é 5 vezes mais barata, a saída é 6 vezes mais barata. Um exemplo concreto: se uma equipe de pequeno a médio porte processa 100 milhões de tokens de entrada e 10 milhões de tokens de saída por mês, ela pode economizar cerca de US$ 4.380 por ano. Para equipes que consideram os custos de chamadas de API como despesas operacionais reais, isso não é um valor pequeno.
Os benchmarks do K2.5 foram de 76,8% (SWE-Bench Verified) e 85% (LiveCodeBench) – isso já era de primeira linha entre os modelos de pesos abertos. Os benchmarks oficiais do K2.6 ainda não foram divulgados, mas desenvolvedores nos testes fechados relataram que a saída do K2.6 "tem um gosto de Opus" – cadeias de raciocínio detalhadas, processos de pensamento estruturados, bastante semelhantes ao verbose chain-of-thought do Claude.
Agent Swarm: Paralelismo real
A mudança técnica mais substancial do K2.6 é a reformulação no nível do Agent Swarm.
O Agent Swarm do Kimi é o mecanismo que permite que até 100 subagentes trabalhem em paralelo. O K2.5 tinha um problema antigo: o Orchestrator (orquestrador) teoricamente suportava paralelismo, mas na prática a execução frequentemente degenerava para processamento sequencial. O K2.6 foi otimizado especificamente para isso; agora o Orchestrator consegue manter a execução paralela real sem degenerar por padrão.
O resultado: em tarefas que podem ser paralelizadas, a velocidade aumentou em até 4,5 vezes. Se você está executando processamento em lote de dados, testes de várias etapas ou sumarização de pesquisa paralela, a diferença será perceptível.
A geração de código front-end também ficou mais bonita – não apenas o código funciona, mas o layout e a lógica visual também fazem mais sentido.
Pesos abertos, pode ser executado localmente
O K2.6 é baseado em uma arquitetura MoE com trilhões de parâmetros, mantendo a estratégia consistente de pesos abertos da Moonshot. Se você está fazendo uma implantação local onde os dados não podem sair do país, ou quer executar em seu próprio cluster de inferência, teoricamente é suportado.
No entanto, a versão completa de pesos abertos ainda não foi lançada; é fornecida principalmente por meio da API e da assinatura do Kimi Code. Os pesos abertos completos devem ser lançados por volta de maio de 2026.
Para equipes que precisam executar grandes Agentes de código em ambientes privados, este momento vale a pena ser anotado.
Algumas limitações reais
A realidade é: nem tudo está resolvido.
- CLI atrasou alguns dias: A API e a interface web foram atualizadas para o K2.6 primeiro; os usuários de linha de comando esperaram cerca de três dias. Para muitos desenvolvedores, a CLI é a principal porta de entrada
- Nomes de versão começaram a ficar confusos: K2, K2.5, K2.6, K2.6-code-preview, K2.6-instruct… difícil saber qual endpoint está executando qual versão, o version pinning se tornou um fardo operacional
- Documentação em inglês ainda está atrasada: Em comparação com Anthropic e OpenAI, a qualidade e a velocidade de atualização da documentação técnica em inglês da Moonshot ainda são inferiores. A experiência do desenvolvedor internacional não é boa
- Limite de frequência de chamadas de API: 300-1200 chamadas a cada 5 horas, insuficiente para tarefas em lote de alta concorrência, exigindo fila própria
K3 ainda está a caminho
O K2.6 foi lançado, mas as discussões sobre o K3 não pararam. Rumores na comunidade dizem que o número de parâmetros alvo do K3 estará na faixa de 3-4 trilhões, rivalizando com os principais modelos dos EUA. A Moonshot confirmou oficialmente no final de março que o K3 está em desenvolvimento, sem revelar recursos específicos.
A forma de lançamento do K2.6 – um e-mail e depois o push direto – mostra que a Moonshot está iterando de forma bastante discreta. Sem grandes anúncios, primeiro deixe os usuários sentirem. Isso não contradiz os rumores de que o K3 "está preparando algo grande".
Para os desenvolvedores, o estado atual é: você pode pagar, os benchmarks são aceitáveis, as desvantagens são toleráveis, então use por enquanto. Quando o K3 for lançado, reavalie.
Fontes de referência: Kimi Code K2.6: Key Takeaways for Developers (BuildFastWithAI); Kimi K2.6 Code Preview Is Here (kimi-k2.org); Moonshot's Kimi K2.5 is open, CocoLoop, 595GB, and built for agent swarms (VentureBeat)