A provedora de inferência Fireworks AI lançou o Ember-1, construído sobre o modelo de pesos abertos Kimi K3, da Moonshot AI. A Fireworks não alterou a arquitetura do modelo, apenas aplicou um pós-treinamento, com um objetivo único: fazer o K3 "pensar" menos e responder com a mesma qualidade. Segundo a empresa, isso reduz em cerca de 40% o número de tokens gerados, praticamente sem perda de qualidade.
Por enquanto, o Ember-1 está disponível como prévia de pesquisa (research preview) na Fireworks Serverless, acessível apenas via API, sem pesos ou código de treinamento divulgados e sem possibilidade de self-hosting. Os preços são os mesmos do K3 na Fireworks: 3 dólares por milhão de tokens de entrada, 0,30 dólar para tokens de entrada em cache e 15 dólares por tokens de saída.
A economia vem principalmente do "pensar"
A Fireworks explicou a motivação em seu blog: os usuários gostam da capacidade de programação do K3, mas sua cadeia de raciocínio é longa demais, o que dificulta reduzir custos em fluxos automatizados de programação. Segundo seus próprios dados, em modelos de raciocínio como o K3, às vezes mais de 90% da saída é gasta em raciocínio interno antes da resposta; quando um agente chama ferramentas passo a passo, o modelo ainda "repensa" o que já havia pensado em cada etapa anterior.
Reduzir o nível de reasoning effort do K3 seria a solução mais direta, e a Fireworks afirma ter testado isso — mas em níveis mais baixos a qualidade caía demais. O Ember-1 segue outro caminho; nas palavras da empresa:
"Ember-1 is Kimi K3 post-trained to reason in fewer tokens, not run at lower effort."
O Ember-1 é o K3 pós-treinado para raciocinar com menos tokens, e não para rodar em um nível de esforço mais baixo.
O treinamento cobriu matemática, programação, seguimento de instruções, diálogo, busca, chamadas de ferramentas e engenharia de software, com mais de 50 experimentos de treinamento e mais de 200 avaliações, tudo executado na própria infraestrutura Serverless Training, com dados próprios. Sobre o algoritmo exato usado, a Fireworks diz apenas que é um método novo, ainda não publicado, e que por ora não pode ser reproduzido externamente.
Resultados de benchmark: uns sobem, outros caem
A Fireworks comparou o Ember-1 com três níveis do K3:
| Benchmark | K3 baixo | K3 alto | K3 Max | Ember-1 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 76,4% | 77,6% | 80,9% | 82,0% |
| SWE-bench Verified | 80,4% | 86,0% | 93,2% | 92,2% |
| DeepSWE 1.1 | 55,8% | 62,8% | 66,4% | 75,2% |
No DeepSWE, o Ember-1 supera o K3 Max em quase 9 pontos percentuais, mas no SWE-bench Verified fica 1 ponto abaixo. Segundo dados citados por veículos terceiros, no SWE-Interact o Ember-1 também fica levemente abaixo do K3 Max. Todos esses são testes internos da Fireworks, ainda sem verificação de uma entidade de avaliação independente.
Mais convincentes são os dados em produção. A Fireworks realizou testes A/B com dois clientes em tráfego real de programação, com uma queda geral de cerca de 35% nos tokens por tarefa. O conjunto de números mais completo mostra: tokens de raciocínio caindo 71,3%, tokens totais caindo 39%, pontuação da tarefa de 0,753 contra 0,751. Um cliente já colocou o Ember-1 em produção; o nome da empresa não foi divulgado.
Uma conta rápida
Como o preço por token é o mesmo, a economia vem inteiramente de gerar menos texto. Com base nesse conjunto de dados A/B, o custo de saída por tarefa do K3 Max fica em torno de 0,74 dólar, e o do Ember-1 em torno de 0,45 dólar. Uma equipe que roda 10 mil tarefas de programação por dia veria o custo diário de saída cair de cerca de 7.400 para cerca de 4.500 dólares — uma diferença de mais de 80 mil dólares por mês. Essa estimativa considera apenas a saída, sem contar entrada e cache; a economia real depende da duração das tarefas.
Para desenvolvedores chineses, o significado do Ember-1 está mais no método do que no produto em si. O K3 é um modelo de pesos abertos, que qualquer um pode pós-treinar, e a Fireworks demonstrou que "comprimir o comprimento do raciocínio" pode virar um produto próprio à venda. Provedoras de inferência na China também têm em mãos modelos abertos como K3, DeepSeek e Qwen, e vale observar se surgirão "versões econômicas de tokens" semelhantes. O próprio Ember-1, para uso a partir da China, precisa passar por uma API no exterior, então latência e conformidade precisam ser avaliadas à parte.
Fontes: blog oficial da Fireworks AI, MarkTechPost, CocoLoop, página de modelos da Fireworks; itens verificados: as três pontuações de benchmark, os dados de tokens e pontuação dos testes A/B, e os preços de entrada/saída por milhão de tokens.