Novo modelo da DeepSeek empata com Astra em codificação, mas custa 15 vezes menos

A Fireworks AI divulgou um conjunto de dados de avaliação do DeepSeek-V4.1-Flash cuja conclusão cabe em uma frase: em tarefas de codificação com agentes, o modelo ficou na mesma faixa de precisão do GPT-6 Astra, mas com um custo por tarefa 15 vezes menor.

Primeiro, as notas. No pass@1 do DeepSWE, o DeepSeek-V4.1-Flash marcou 74,34%, o GPT-6 Astra 74,12%, o Gemini 3.8 Flash 73,83% e o Claude Opus 5 73,65%. Os quatro modelos ficaram espremidos numa faixa de apenas 0,69 ponto percentual, tornando a disputa pelo primeiro lugar pouco relevante. No Terminal-Bench 2.1, a DeepSeek fez 86,5% e a Astra 87,5%, ligeiramente à frente.

A conta fecha assim

Segundo a Fireworks, o custo por tarefa é: DeepSeek-V4.1-Flash, 0,430 dólar; Gemini 3.8 Flash, 2,362 dólares; GPT-6 Astra, 6,524 dólares; Claude Opus 5, 11,838 dólares. Tomando a DeepSeek como referência, os outros três custam 5,5, 15 e 28 vezes mais, respectivamente.

Fazendo uma conta aproximada do peso dessa diferença num orçamento real: uma equipe de dez engenheiros, cada um executando 20 tarefas de codificação com agentes por dia, ao longo de 22 dias úteis no mês, soma 4.400 tarefas. Pelo caminho da DeepSeek, o custo fica em torno de 1.892 dólares; pelo caminho da Astra, cerca de 28.706 dólares — uma diferença de aproximadamente 26.800 dólares por mês e cerca de 320.000 dólares por ano. É uma estimativa: a distribuição real de tokens das tarefas não será idêntica à do benchmark, mas a ordem de grandeza deve se manter.

A brecha no HLE

O mesmo conjunto de dados mostra uma diferença no sentido oposto. No Humanity's Last Exam, o DeepSeek-V4.1-Flash marcou 34,52% e o GPT-6 Astra 50,40%, uma diferença de 15,88 pontos percentuais. O empate nas tarefas de codificação não se repete nesse tipo de raciocínio geral de alta complexidade.

A Fireworks também apresentou um número de referência chamado Oracle Router: combinando os dois modelos, o resultado teórico chega a 54,80%. Esse é um valor-teto, que pressupõe saber de antemão para qual modelo encaminhar cada pergunta. Um sistema de roteamento real não tem acesso a essa informação; o número serve mais para mostrar que os pontos fracos dos dois modelos não se sobrepõem do que como uma solução aplicável na prática.

O lado da arquitetura

O modelo em si é um MoE de 552 bilhões de parâmetros, com ativação separada para entrada e saída: 8 bilhões de parâmetros ativos na entrada e 16 bilhões na saída. A mudança no KV cache é mais direta: o uso de HBM caiu para um quarto do da geração anterior, e o de SSD, para um oitavo.

A origem da vantagem de custo bate com essa camada. Tarefas de codificação com agentes têm contexto longo e muitas rodadas, o que faz o custo do KV cache pesar bem mais do que numa pergunta única. Ao reduzir o uso de memória e disco do cache para um quarto e um oitavo, o provedor consegue encaixar mais requisições simultâneas no mesmo hardware, o que permite baixar o preço por tarefa. O valor de 0,43 dólar não vem só de uma estratégia de precificação.

De onde vêm esses números

É preciso deixar claro que essa avaliação foi divulgada pela própria Fireworks AI, que também vende o DeepSeek-V4.1-Flash em sua plataforma — quem avalia e quem vende são a mesma empresa. A DeepSeek não confirmou oficialmente esses números, e até agora não há reprodução independente por terceiros.

A escolha dos benchmarks também influencia a conclusão. DeepSWE e Terminal-Bench favorecem tarefas de código mais próximas da engenharia, com boa sobreposição com o desenvolvimento do dia a dia, mas, trocando o conjunto de referência ou a distribuição das tarefas, não há como saber, a partir desses dados, se as posições relativas dos quatro modelos se manteriam dentro de 0,69 ponto percentual. Serve para ilustrar a relação de custos, não para estabelecer um ranking definitivo de capacidade.

Fontes: blog técnico da Fireworks AI, CocoLoop; as três notas de DeepSWE, Terminal-Bench 2.1 e HLE, além do custo por tarefa e dos parâmetros de arquitetura, foram conferidos item a item com o post original; o gasto mensal da equipe de dez pessoas é uma estimativa aproximada.