Fireworks reformula o Kimi K3 e reduz tokens em 40%

A provedora de inferência Fireworks AI lançou o Ember-1, construído sobre o modelo de pesos abertos Kimi K3, da Moonshot AI. A Fireworks não alterou a arquitetura do modelo, apenas aplicou um pós-treinamento, com um objetivo único: fazer o K3 "pensar" menos e responder com a mesma qualidade. Segundo a empresa, isso reduz em cerca de 40% o número de tokens gerados, praticamente sem perda de qualidade.

Por enquanto, o Ember-1 está disponível como prévia de pesquisa (research preview) na Fireworks Serverless, acessível apenas via API, sem pesos ou código de treinamento divulgados e sem possibilidade de self-hosting. Os preços são os mesmos do K3 na Fireworks: 3 dólares por milhão de tokens de entrada, 0,30 dólar para tokens de entrada em cache e 15 dólares por tokens de saída.

A economia vem principalmente do "pensar"

A Fireworks explicou a motivação em seu blog: os usuários gostam da capacidade de programação do K3, mas sua cadeia de raciocínio é longa demais, o que dificulta reduzir custos em fluxos automatizados de programação. Segundo seus próprios dados, em modelos de raciocínio como o K3, às vezes mais de 90% da saída é gasta em raciocínio interno antes da resposta; quando um agente chama ferramentas passo a passo, o modelo ainda "repensa" o que já havia pensado em cada etapa anterior.

Reduzir o nível de reasoning effort do K3 seria a solução mais direta, e a Fireworks afirma ter testado isso — mas em níveis mais baixos a qualidade caía demais. O Ember-1 segue outro caminho; nas palavras da empresa:

"Ember-1 is Kimi K3 post-trained to reason in fewer tokens, not run at lower effort."

O Ember-1 é o K3 pós-treinado para raciocinar com menos tokens, e não para rodar em um nível de esforço mais baixo.

O treinamento cobriu matemática, programação, seguimento de instruções, diálogo, busca, chamadas de ferramentas e engenharia de software, com mais de 50 experimentos de treinamento e mais de 200 avaliações, tudo executado na própria infraestrutura Serverless Training, com dados próprios. Sobre o algoritmo exato usado, a Fireworks diz apenas que é um método novo, ainda não publicado, e que por ora não pode ser reproduzido externamente.

Resultados de benchmark: uns sobem, outros caem

A Fireworks comparou o Ember-1 com três níveis do K3:

BenchmarkK3 baixoK3 altoK3 MaxEmber-1
Terminal Bench 2.176,4%77,6%80,9%82,0%
SWE-bench Verified80,4%86,0%93,2%92,2%
DeepSWE 1.155,8%62,8%66,4%75,2%

No DeepSWE, o Ember-1 supera o K3 Max em quase 9 pontos percentuais, mas no SWE-bench Verified fica 1 ponto abaixo. Segundo dados citados por veículos terceiros, no SWE-Interact o Ember-1 também fica levemente abaixo do K3 Max. Todos esses são testes internos da Fireworks, ainda sem verificação de uma entidade de avaliação independente.

Mais convincentes são os dados em produção. A Fireworks realizou testes A/B com dois clientes em tráfego real de programação, com uma queda geral de cerca de 35% nos tokens por tarefa. O conjunto de números mais completo mostra: tokens de raciocínio caindo 71,3%, tokens totais caindo 39%, pontuação da tarefa de 0,753 contra 0,751. Um cliente já colocou o Ember-1 em produção; o nome da empresa não foi divulgado.

Uma conta rápida

Como o preço por token é o mesmo, a economia vem inteiramente de gerar menos texto. Com base nesse conjunto de dados A/B, o custo de saída por tarefa do K3 Max fica em torno de 0,74 dólar, e o do Ember-1 em torno de 0,45 dólar. Uma equipe que roda 10 mil tarefas de programação por dia veria o custo diário de saída cair de cerca de 7.400 para cerca de 4.500 dólares — uma diferença de mais de 80 mil dólares por mês. Essa estimativa considera apenas a saída, sem contar entrada e cache; a economia real depende da duração das tarefas.

Para desenvolvedores chineses, o significado do Ember-1 está mais no método do que no produto em si. O K3 é um modelo de pesos abertos, que qualquer um pode pós-treinar, e a Fireworks demonstrou que "comprimir o comprimento do raciocínio" pode virar um produto próprio à venda. Provedoras de inferência na China também têm em mãos modelos abertos como K3, DeepSeek e Qwen, e vale observar se surgirão "versões econômicas de tokens" semelhantes. O próprio Ember-1, para uso a partir da China, precisa passar por uma API no exterior, então latência e conformidade precisam ser avaliadas à parte.

Fontes: blog oficial da Fireworks AI, MarkTechPost, CocoLoop, página de modelos da Fireworks; itens verificados: as três pontuações de benchmark, os dados de tokens e pontuação dos testes A/B, e os preços de entrada/saída por milhão de tokens.