Kimi K2.6 conquista primeiro lugar open source no ranking HLE

A Moonshot AI lançou na semana passada a versão completa do Kimi K2.6 – não uma "prévia de código" de teste, mas um modelo de produção completo. A prévia de código já havia gerado atenção, mas após a divulgação das especificações técnicas e resultados de benchmark da versão completa, a situação se mostrou mais interessante do que muitos esperavam.

HLE-Full 54,0: primeiro lugar open source realmente conquistado

HLE (Humanity's Last Exam) é um dos rankings de avaliação de IA mais valiosos deste ano, com 2.500 questões em nível de doutorado abrangendo mais de 100 áreas acadêmicas – não é algo que se possa enganar com alguns exemplos few-shot.

Resultados do Kimi K2.6:

Modelo HLE-Full (com ferramentas)
Kimi K2.6 54,0
Claude Opus 4.6 53,0
GPT-5.4 52,1

A diferença não é grande, mas a direção é clara: um modelo open source superou dois modelos fechados de ponta no ranking de raciocínio acadêmico de elite. SWE-Bench Pro 58,6, BrowseComp 83,2, CharXiv (com Python) 86,7, raciocínio visual matemático 93,2.

A Moonshot AI usou a expressão "far more execution and imagination" no comunicado de lançamento para descrever as melhorias desta versão.

1 trilhão de parâmetros, mas apenas 32 bilhões ativados

Esta é a lógica central da arquitetura MoE. O Kimi K2.6 é um modelo Mixture-of-Experts com 1 trilhão de parâmetros, ativando apenas 32 bilhões de parâmetros por inferência. 384 especialistas são gerenciados em grupos, cada resposta chama 8 especialistas de roteamento mais 1 especialista compartilhado. O benefício é bidirecional:

  • Lado do treinamento: Grande número total de parâmetros, mais conhecimento aprendido
  • Lado da inferência: Poucos parâmetros ativados, custo computacional controlável

O mecanismo de atenção usa MLA (Multi-Head Latent Attention), que comprime dados processados em representações matemáticas leves, reduzindo o uso de cache KV. A função de ativação é SwiGLU, mais amigável ao hardware que a geração anterior. O módulo visual é um codificador separado de 400 milhões de parâmetros, suportando entrada de imagem e multimídia.

A janela de contexto é de 256K, e também suporta quantização INT4, abrindo caminho para implantação local.

300 agentes paralelos, 12 horas de operação contínua

Esta é a parte que realmente interessa aos desenvolvedores no Kimi K2.6:

  • Suporta até 300 subagentes em paralelo
  • Até mais de 4.000 chamadas de ferramentas em uma única tarefa
  • Tempo de operação contínua de até 12 horas sem interrupção

Para suportar essa colaboração multiagente em escala, a Moonshot AI introduziu "Claw Groups" – dividindo grandes tarefas em subgrupos que permitem que humanos e IA executem em conjunto. Humanos intervêm em pontos de decisão críticos, a IA executa a maior parte das operações intermediárias, logicamente similar à divisão de trabalho humano-máquina em uma linha de produção fabril.

Para aplicações empresariais, este design é muito prático. Fluxos de trabalho reais não são uma escolha entre "automação total" ou "totalmente manual", mas exigem supervisão humana em pontos críticos, enquanto a IA realiza grande parte do trabalho intermediário.

Ecossistema open source pronto desde o primeiro dia

No dia do lançamento, o modelo já suportava vLLM, OpenRouter, Cloudflare Workers AI e MLX – resultado de meses de trabalho de integração com o ecossistema iniciado com antecedência.

  • MLX: Pode ser executado no Apple Silicon
  • OpenRouter: Integração direta com a plataforma de agregação de API
  • vLLM: Implantação de inferência de alto throughput sem obstáculos
  • Cloudflare Workers AI: Inferência de borda tem um caminho

Concluir essas integrações no primeiro dia não foi acidental, mostrando que a Moonshot AI fez uma preparação técnica séria antes do lançamento.

Corrida open source está acompanhando seriamente

No ano passado, ainda havia quem dissesse "modelos open source têm uma diferença clara para o GPT-4". Este ano, essa afirmação não se sustenta mais.

O Kimi K2.6 superou Claude Opus 4.6 e GPT-5.4 no HLE. O DeepSeek V3.2 mudou a atenção para estrutura esparsa, cortando custos pela metade. O Qwen3.6-35B roda em MacBook, SWE-bench 73,4%.

Open source não é mais uma alternativa barata ao código fechado, mas está liderando em dimensões específicas de benchmark. Para empresas, isso significa que necessidades como implantação privada, confidencialidade de dados e controle de custos finalmente têm opções de nível flagship disponíveis.

Claro, ainda há distância entre resultados de benchmark e a prática de produção. O 54,0 no HLE e a depuração de código cotidiana, compreensão de documentos longos e diálogos de múltiplas rodadas são coisas diferentes. Mas a direção já está clara: a Moonshot AI está lutando seriamente nesta batalha, e esta rodada eles venceram.

Fonte de referência: Moonshot AI releases Kimi-K2.6 model with 1T parameters,CocoLoop、 attention optimizations(SiliconANGLE);[AINews] Moonshot Kimi K2.6: the world's leading Open Model refreshes to catch up to Opus 4.6(Latent Space)