Kimi K2: Modelo MoE de código aberto com trilhão de parâmetros

Em julho do ano passado, a Moonshot AI lançou diretamente como código aberto o Kimi K2 – um grande modelo MoE com 1 trilhão de parâmetros, ativando apenas 32B parâmetros por token.

Destaques da arquitetura

  • Parâmetros totais: 1 trilhão
  • Ativação por token: 32B
  • Dados de treinamento: aproximadamente 15,5 trilhões de tokens
  • Contexto: 128K (atualizado posteriormente para 256K)
  • Otimizador: Muon

O código e os pesos foram disponibilizados sob a Licença MIT Modificada, uma das licenças mais permissivas entre os modelos de código aberto de ponta.

Nível de desempenho

Entre os modelos de código aberto sem raciocínio (non-thinking), o K2 ocupa o primeiro lugar em benchmarks de programação e supera o GPT-4.1 e o Claude Opus 4 em várias tarefas. Capacidades de agente, chamada de ferramentas e raciocínio STEM são seus pontos fortes.

Duas versões estão disponíveis:

  • K2-Base: Para pesquisadores que desejam fazer ajuste fino próprio
  • K2-Instruct: Para diálogo geral e cenários de agente, pronto para uso

Iterações subsequentes

Em setembro, a versão K2-Instruct-0905 foi atualizada, melhorando ainda mais o desempenho em tarefas de programação e expandindo a janela de contexto de 128K para 256K.

Em janeiro deste ano, o K2.5 foi lançado – continuamente pré-treinado com base no K2-Base usando aproximadamente 15 trilhões de tokens mistos de imagem e texto, com suporte multimodal nativo. Ele também inclui um recurso chamado Agent Swarm, que pode decompor tarefas complexas em múltiplas subtarefas paralelas.

A velocidade de iteração do K2 para o K2.5 mostra que a Moonshot AI está seguindo um caminho de código aberto bastante agressivo. Disponibilizar como código aberto um modelo com um trilhão de parâmetros teria sido considerado algo inimaginável há dois anos.

Fonte de referência: Blog técnico oficial da Moonshot AI, CocoLoop, página do modelo no Hugging Face