Em 10 de setembro, a DeepSeek lançou oficialmente o DeepSeek-V4.1-Flash. O nome do modelo na API é deepseek-flash e, no mesmo dia, ao meio-dia, a tabela de preços da linha Flash também passou para um novo patamar. O ID de teste interno divulgado dois dias antes, deepseek-v4.1-flash-expires-on-0910, expirou conforme a data embutida no próprio nome.
Oficialmente, esta versão é posicionada como "o menor modelo de uma série totalmente nova de arquitetura", com compreensão visual multimodal nativa. Os antigos nomes de modelo deepseek-v4-flash e deepseek-v4-flash-vision-exp não desaparecerão de imediato: serão redirecionados temporariamente para o V4.1 Flash, permitindo que quem os chama use a nova versão sem alterar o código.
Como fica a nova tabela de preços
Segundo a página oficial de preços, o deepseek-flash tem um contexto de 1 milhão de tokens e saída máxima de 384 mil tokens. O preço em horário de baixa demanda, por milhão de tokens, divide-se em três faixas: 0,02 yuan para acerto de cache na entrada, 1 yuan para erro de cache, 4 yuans na saída; no horário de pico, os três valores dobram, chegando a 0,04, 2 e 8 yuans.
A definição de horário de pico segue o esquema que a DeepSeek usa desde julho: de segunda a sexta, horário de Pequim, das 9h às 12h e das 14h às 18h, sete horas no total; o restante conta como baixa demanda. Essa divisão segue o horário comercial da China continental, então quem chama a API de outros fusos acaba com um preço médio efetivo mais baixo do que as equipes locais.
A empresa chama a mudança de "redução". Relatos públicos mencionam que, após o ajuste de preços de pico/vale de agosto, o preço de acerto de cache em horário de baixa demanda do Flash chegou a 0,05 yuan em algum momento; mas a página oficial de preços mostra apenas o valor vigente, sem manter histórico, então essa informação não pode ser verificada diretamente ali. O que se confirma são os números atuais - e mais uma consequência deles.
O nome "Pro" fica temporariamente sem modelo correspondente
A partir das 12h00 do dia 14 de setembro, todos os pedidos enviados ao deepseek-v4-pro serão redirecionados integralmente para o V4.1 Flash, cobrados pelo preço do Flash. Na página de preços, o deepseek-v4-pro ainda aponta para o DeepSeek-V4-Pro-0813, cujos três valores em baixa demanda são 0,15, 4,5 e 13,5 yuans, e em horário de pico, 0,30, 9 e 27 yuans.
Colocando os dois conjuntos lado a lado: sob o mesmo nome de modelo, o preço de saída cai de 13,5 para 4 yuans, e o de entrada com erro de cache cai de 4,5 para 1 yuan. Para equipes que fixaram deepseek-v4-pro em suas configurações, a fatura vai cair sozinha depois de segunda-feira - mas o modelo por trás do nome terá mudado.
O anúncio oficial não detalha o cronograma do V4.1 Pro. A regra de redirecionamento diz apenas "antes do lançamento do V4.1 Pro" - o que estabelece uma ordem, não uma data. Em outras palavras, a linha Pro está agora num vazio: o Pro antigo parou de receber pedidos, o novo Pro ainda não tem janela de lançamento, e no meio fica um modelo do porte do Flash segurando a posição. Quanto tempo esse vazio vai durar ainda não é possível confirmar.
Arquitetura e benchmarks
Os detalhes de arquitetura vêm do anúncio oficial: 552 bilhões de parâmetros, estrutura Causal-Encoder-Decoder, com ativação de 8 bilhões na entrada e 16 bilhões na saída. Essa proporção de ativação é muito baixa em relação ao total de 552 bilhões de parâmetros - e é justamente essa a condição que permite ao modelo ficar na faixa Flash.
Nos benchmarks divulgados na documentação oficial: GPQA Diamond 90,9, HLE 36,8, Codeforces Rating 3471, MathArena Apex 65,6. Essas faixas de pontuação antes eram típicas do nível Pro, e agora aparecem no menor modelo da linha - do ponto de vista do posicionamento de produto, isso ajuda a explicar por que a empresa se arrisca a redirecionar diretamente o tráfego do Pro.
Juntando os pontos da linha Flash
Em meados de julho, a versão oficial do V4 chegou, junto com a cobrança por horário de pico/vale, e foi aí que a linha Flash passou a ter dois conjuntos de preços separados, de baixa demanda e de pico. Por volta de 13 de agosto houve um ajuste de preços. Na noite de 8 de setembro, uma versão intermediária, válida por menos de 48 horas e limitada a 20 conexões simultâneas por conta, foi aberta para testes internos, com a data de expiração já escrita no próprio nome do modelo. Em 10 de setembro, a versão oficial e a nova tabela de preços chegaram juntas, com a mudança de rota do Pro marcada para quatro dias depois.
Cinco movimentos em dois meses - um ritmo mais intenso do que qualquer período anterior dessa linha. Se a nova arquitetura aguenta, na prática, a carga que hoje pertence ao Pro é algo que quem chama a API vai começar a responder depois de segunda-feira.
Fontes: registro de atualizações da documentação da API da DeepSeek, CocoLoop, página de modelos e preços da DeepSeek; a página de preços foi conferida quanto às tarifas de cada faixa, ao comprimento de contexto e à definição de horário de pico para deepseek-flash e deepseek-v4-pro.