DeepSeek lance V4.1 Flash, les requêtes Pro changent de route lundi

Le 10 septembre, DeepSeek a officiellement lancé DeepSeek-V4.1-Flash. Le nom du modèle côté API est deepseek-flash, et le même jour à midi, la grille tarifaire de la gamme Flash est elle aussi passée à un nouveau palier. L'identifiant de version bêta publié deux jours plus tôt, deepseek-v4.1-flash-expires-on-0910, a expiré à la date indiquée dans son propre nom.

Officiellement, cette version est présentée comme "le plus petit modèle d'une série entièrement nouvelle en termes d'architecture", doté d'une compréhension visuelle multimodale native. Les anciens noms de modèles deepseek-v4-flash et deepseek-v4-flash-vision-exp ne disparaissent pas immédiatement : ils sont temporairement redirigés vers V4.1 Flash, ce qui permet aux appelants d'utiliser la nouvelle version sans modifier leur code.

À quoi ressemble la nouvelle grille tarifaire

Selon la page officielle des prix, deepseek-flash dispose d'un contexte de 1 million de tokens et d'une sortie maximale de 384 000 tokens. Le tarif en heures creuses par million de tokens se décompose en trois paliers : 0,02 yuan pour un cache-hit en entrée, 1 yuan pour un cache-miss, 4 yuans pour la sortie ; en heures pleines, ces trois valeurs doublent, pour atteindre 0,04, 2 et 8 yuans.

La définition des heures pleines reprend le schéma utilisé par DeepSeek depuis juillet : du lundi au vendredi, heure de Pékin, de 9h à 12h et de 14h à 18h, soit sept heures au total ; le reste du temps compte comme heures creuses. Ce découpage suit les horaires de bureau en Chine continentale, si bien que les appelants situés dans d'autres fuseaux horaires obtiennent un prix moyen effectif plus bas que les équipes basées en Chine.

L'entreprise qualifie ce changement de "baisse". Des rapports publics indiquent qu'après l'ajustement des tarifs heures pleines/creuses d'août, le prix du cache-hit en heures creuses pour Flash avait ponctuellement atteint 0,05 yuan ; mais la page officielle des prix n'affiche que le tarif en vigueur, sans conserver d'historique, ce qui rend cette information impossible à vérifier directement sur la page officielle. Ce qui est confirmé, ce sont les chiffres actuels - et une autre conséquence qui les accompagne.

Le nom "Pro" se retrouve temporairement sans modèle correspondant

À partir de 12h00 le 14 septembre, toutes les requêtes envoyées à deepseek-v4-pro seront intégralement redirigées vers V4.1 Flash, facturées au tarif Flash. Sur la page des prix, deepseek-v4-pro continue de pointer vers DeepSeek-V4-Pro-0813, dont les trois valeurs en heures creuses sont 0,15, 4,5 et 13,5 yuans, et en heures pleines, 0,30, 9 et 27 yuans.

En mettant les deux séries de chiffres côte à côte : sous un même nom de modèle, le prix de sortie tombe de 13,5 à 4 yuans, et celui de l'entrée en cas de cache-miss tombe de 4,5 à 1 yuan. Pour les équipes qui ont figé deepseek-v4-pro dans leur configuration, la facture baissera d'elle-même après lundi - mais le modèle derrière ce nom aura changé.

L'annonce officielle ne précise pas de calendrier pour V4.1 Pro. La règle de redirection se contente de dire "avant le lancement de V4.1 Pro" - ce qui fixe un ordre, pas une date. Autrement dit, la gamme Pro se trouve actuellement dans un vide : l'ancien Pro n'accepte plus de requêtes, le nouveau Pro n'a pas encore de fenêtre de sortie, et entre les deux, un modèle de la taille de Flash tient la place. On ne peut pas dire aujourd'hui combien de temps ce vide va durer.

Architecture et benchmarks

Les détails d'architecture proviennent de l'annonce officielle : 552 milliards de paramètres, une structure Causal-Encoder-Decoder, avec une activation de 8 milliards en entrée et 16 milliards en sortie. Ce taux d'activation est très faible par rapport au total de 552 milliards de paramètres - et c'est justement cette condition qui permet au modèle de se classer dans la gamme Flash.

Dans les benchmarks publiés par la documentation officielle : GPQA Diamond 90,9, HLE 36,8, Codeforces Rating 3471, MathArena Apex 65,6. Ces scores relevaient jusqu'ici de la gamme Pro, et les voilà désormais atteints par le plus petit modèle - du point de vue du positionnement produit, cela explique pourquoi l'entreprise ose rediriger directement le trafic de Pro.

Relier les étapes de la gamme Flash

Mi-juillet, la version officielle de V4 est arrivée, en même temps que la facturation par tranches heures pleines/creuses - c'est à ce moment que la gamme Flash a obtenu pour la première fois deux grilles tarifaires distinctes, creuses et pleines. Vers le 13 août a eu lieu un ajustement de prix. Dans la soirée du 8 septembre, une version intermédiaire, valable moins de 48 heures et limitée à 20 connexions simultanées par compte, a été ouverte en test interne, avec la date d'expiration inscrite directement dans le nom du modèle. Le 10 septembre, la version officielle et la nouvelle grille tarifaire sont arrivées ensemble, le changement de route de Pro étant fixé quatre jours plus tard.

Cinq mouvements en deux mois, un rythme plus soutenu qu'à n'importe quelle période précédente de cette gamme. Reste à savoir si la nouvelle architecture tiendra la charge réelle qui revient aujourd'hui à Pro - une question à laquelle les appelants commenceront à répondre après lundi.

Sources : journal des mises à jour de la documentation API de DeepSeek, CocoLoop, page des modèles et des tarifs de DeepSeek ; la page des prix a été vérifiée pour chaque palier tarifaire, la longueur de contexte et la définition des heures pleines de deepseek-flash et deepseek-v4-pro.