DeepSeek abre a API final do V4-Flash

A DeepSeek abriu em 31 de julho o beta público da API final do V4-Flash. Os modelos da web e do aplicativo não mudaram, nem a API do V4-Pro. A atualização mira interfaces para desenvolvedores, agentes de código e fluxos do Codex.

O número central é 82,7 no Terminal Bench 2.1. A tabela da empresa mostra 61,8 para o V4-Flash Preview e 72,1 para o V4-Pro Preview. O ganho sobre o Flash anterior é de 20,9 pontos, ou cerca de 33,8% em termos relativos.

Pós-treinamento sem ampliar o modelo

“O DeepSeek-V4-Flash-0731 mantém a mesma arquitetura e o mesmo tamanho do DeepSeek-V4-Flash-preview e passou apenas por novo pós-treinamento.”

O relatório técnico e o model card do V4 descrevem 284 bilhões de parâmetros totais e 13 bilhões de parâmetros ativos por token, com contexto de um milhão de tokens. A DeepSeek atribui a melhora ao pós-treinamento, não a uma rede maior.

Com esforço máximo e o modo mínimo ainda não publicado do DeepSeek Harness, a empresa informa 82,7 no Terminal Bench 2.1, 54,2 no NL2Repo, 76,7 no CyberGym, 54,4 no DeepSWE, 70,3 no Toolathlon-Verified, 68,7 no DSBench-FullStack e 59,6 no DSBench-Hard.

Anúncio dos benchmarks da API final do DeepSeek V4-Flash
Anúncio oficial e tabela comparativa do V4-Flash 0731.

As condições precisam acompanhar os números. As tarefas públicas de Code Agent usaram top_p=0.95, temperature=1.0 e esforço máximo. Os dois DSBench são internos. O ranking público do CyberGym ainda não inclui o V4-Flash 0731; por isso, 76,7 continua sendo um resultado do fornecedor, sem reprodução independente.

O CyberGym reúne 1.507 vulnerabilidades históricas de 188 grandes projetos de código aberto. O teste verifica se um agente cria um PoC funcional contra código ainda não corrigido. Framework e número de tentativas afetam o resultado, tornando a publicação do harness o primeiro ponto de verificação.

O suporte ao Codex começa pelo protocolo

O V4-Flash aceita o formato Responses API em https://api.deepseek.com, com o nome deepseek-v4-flash. É possível usar o padrão client.responses.create() do OpenAI SDK e configurar o Codex para chamar a DeepSeek.

Há suporte a function tools, web search no servidor, ao recurso personalizado apply_patch do Codex, a streaming SSE, reasoning effort e saída JSON.

A compatibilidade de protocolo não inclui toda a plataforma Responses. previous_response_id, conversation, store, background e context management não funcionam. File search, code interpreter, computer use e MCP são ignorados. A API não guarda estado, então o cliente precisa reenviar o contexto de várias rodadas.

O preço não subiu com os benchmarks

O V4-Flash custa 0,02 yuan por milhão de tokens de entrada em cache, 1 yuan sem cache e 2 yuan de saída. Oferece contexto de um milhão de tokens, saída de até 384 mil tokens e limite de concorrência de 2.500 por conta. No V4-Pro, as três faixas custam 0,025, 3 e 6 yuan, com limite de 500.

A Responses API aceita apenas o V4-Flash por enquanto; o V4-Pro está previsto para o início de agosto. Os próximos testes são a liberação do harness, a reprodução independente de 82,7 e 76,7 e o consumo de tokens e taxa de conclusão em trabalhos reais.

Fontes: changelog da API, documentação da Responses API e preços da DeepSeek; CocoLoop; relatório técnico do V4 e model card no Hugging Face para a estrutura 284B/13B, contexto de 1M e referências Preview; site oficial do CyberGym para definição do benchmark e estado da reprodução pública.