DeepSeek teste le chat vocal en phase progressive, avec quatre voix au choix

Depuis le 12 septembre, de plus en plus d'utilisateurs remarquent une nouvelle petite icône de haut-parleur en haut à droite de l'app DeepSeek ; un clic dessus ouvre le chat vocal. Les comptes ayant accès au test voient aussi apparaître une nouvelle option, « voix de lecture », dans l'onglet voix des réglages.

Il y a quatre voix, aux noms et descriptions courts : Coquillage (polyvalente et vive), Vague Blanche (claire et affirmée), Étoile de Mer (espiègle et douce), Courant Sombre (grave et pleine). Les quatre noms viennent de la mer.

Cette mise à jour n'a fait l'objet d'aucune annonce officielle, l'information vient des retours d'utilisateurs. Quelle est la part du test progressif, quels modèles d'appareils sont couverts, quand aura lieu le déploiement complet — DeepSeek n'a pour l'instant rien expliqué.

Deux événements à deux jours d'écart

Deux jours plus tôt, le 10 septembre, DeepSeek avait lancé V4.1 Flash, le modèle le plus compact de sa nouvelle série d'architecture, doté d'une compréhension visuelle multimodale native. Cette fois-là, le processus de lancement officiel a été suivi, avec annonce et documentation technique.

Les deux événements se sont produits à quelques jours d'intervalle, mais la démarche est totalement différente. Côté modèle, tout est public, documenté, vérifiable ; côté app, le changement a été déployé en silence, sans communiqué, laissant les utilisateurs le découvrir eux-mêmes. C'est la répartition habituelle chez DeepSeek : le modèle, c'est ce qu'on annonce ; le produit, c'est ce qu'on lance d'abord.

Sur le plan fonctionnel, ce qui arrive cette fois est un duo lecture-conversation, encore loin du chat vocal en temps réel qui fait aujourd'hui référence. Le terme même de « voix de lecture » renvoie à la conversion de texte en parole, autrement dit le modèle termine d'écrire avant de la lire à voix haute — ce qui diffère d'une interaction full-duplex, avec interruption, prise de parole en cours d'échange, écoute et réflexion simultanées. Rien n'indique pour l'instant qu'un mode vocal plus complet soit en préparation.

Quelques différences concrètes pour les utilisateurs en Chine

Premièrement, la disponibilité. Pendant le test progressif, la seule façon de savoir est d'ouvrir l'app et de vérifier si l'icône de haut-parleur apparaît en haut à droite. Son absence signifie simplement que ce n'est pas encore son tour ; réinstaller l'app ou changer de compte n'y change rien. Ce mode de déploiement est courant chez les apps chinoises : l'avantage est qu'en cas de problème, l'impact reste limité ; le prix à payer est qu'aucune échéance prévisible n'est communiquée aux utilisateurs.

Deuxièmement, la position par rapport à la concurrence. Plusieurs des principales apps d'IA chinoises ont lancé leurs fonctions vocales bien plus tôt, Doubao, Tongyi, Yuanbao et Kimi tournent déjà depuis un moment, certaines parvenant même à l'interruption en temps réel. En arrivant maintenant sur ce terrain, DeepSeek comble surtout une lacune de complétude produit.

Troisièmement, l'évolution des cas d'usage. La base d'utilisateurs de DeepSeek penche vers les textes longs, le code et les tâches de raisonnement, des scénarios où le bénéfice de la voix n'est déjà pas très élevé en soi — faire lire du code à voix haute n'a guère de sens, et faire narrer un long raisonnement est plutôt éprouvant. La voix trouvera ici plus probablement sa place dans deux situations : écouter des résultats pendant un trajet ou des tâches ménagères, et dicter une question quand taper est peu pratique. La conception des quatre voix ressemble d'ailleurs davantage à un ajustement de préférence d'écoute qu'à un remplacement du mode d'interaction.

Quatrièmement, une information que cette mise à jour laisse transparaître. Le rythme de mise à jour produit de DeepSeek a toujours été plus lent que celui de ses concurrents, le côté app se limitant longtemps à la fenêtre de discussion la plus basique. La voix en test progressif, ajoutée à la compréhension visuelle native de V4.1 Flash — les deux axes réunis montrent que l'éventail de capacités de l'app s'étend progressivement vers le multimodal. Jusqu'où cela ira, et si cela ira vers l'interaction en temps réel, l'entreprise n'a donné aucune indication officielle.

Pour les utilisateurs qui veulent utiliser la voix dès maintenant, le seul conseil pratique est d'attendre. Le test progressif n'a ni canal d'inscription ni règle de file d'attente publique.

Sources : IT Home, Sina Tech, CocoLoop, page des réglages de l'app DeepSeek ; les noms et descriptions des quatre voix, la date de début du test progressif et la date de lancement de V4.1 Flash ont été vérifiés.