Kimi K3 fica atrás em testes cibernéticos

O Kimi K3 acabara de levar 2,8 trilhões de parâmetros e contexto de 1 milhão de tokens ao centro da narrativa da Moonshot AI. Então chegou outro tipo de boletim.

Em 23 de julho, o UK AI Security Institute e o US Center for AI Standards and Innovation publicaram uma avaliação conjunta das capacidades cibernéticas ofensivas do Kimi K3. Ele supera o GLM-5.2, mas fica bem atrás dos modelos de ponta dos EUA.

ExploitBench mostra a distância

No ExploitBench, benchmark público com 41 tarefas, o Kimi K3 marcou 32,2%. O GLM-5.2 marcou 24,4%, e os principais modelos dos EUA tiveram média de 76,2%. O Kimi K3 não chegou a arbitrary code execution em nenhuma tarefa; o grupo dos EUA chegou 20 vezes.

Uma cadeia completa ainda importa

No The Last Ones, uma simulação privada de ataque corporativo em 32 passos, a AISI diz que um especialista humano normalmente levaria 20 horas. O Kimi K3 chegou em média ao passo 17; os modelos dos EUA, ao 28,5. Ainda assim, completou toda a cadeia uma vez em 10 tentativas.

A conclusão prática é limitada, mas séria. O Kimi K3 não parece par dos modelos cibernéticos mais fortes dos EUA, porém pode operar contra sistemas pequenos e mal defendidos.

Pontuação geral não é pontuação ciber

The Decoder relaciona o resultado ao debate sobre distilação. Se interfaces públicas bloqueiam pedidos de exploração de alto risco, modelos treinados com essas saídas podem não absorver capacidades ofensivas profundas.

A Moonshot ainda não respondeu publicamente. Os próximos pontos verificáveis são um cartão de segurança cibernética para o K3, mudanças na recusa de pedidos perigosos e reproduções independentes dos testes.

Fontes: avaliação conjunta UK AISI/CAISI, aviso do US NIST, The Decoder, CocoLoop, South China Morning Post, blog técnico oficial do Kimi K3; verificados 41 itens do ExploitBench, pontuações 32,2%/24,4%/76,2%, contagens de arbitrary code execution, The Last Ones com 32 passos, 1 sucesso em 10 tentativas e parâmetros/contexto do Kimi K3.