StepFun dévoile cinq modèles vocaux, le taux d'erreur de mots tombe à 1,7 %

Le 15 septembre, StepFun a présenté la série StepAudio 3, dévoilant d'un coup cinq modèles : StepAudio 3 Realtime, ASR, TTS, Gen et Music, tous désormais disponibles sur la plateforme ouverte de StepFun.

Selon le classement de l'organisme d'évaluation indépendant Artificial Analysis, Realtime obtient un score global de 98,9 % dans la catégorie Conversational Dynamics, se classant premier ; dans le classement Speech Reasoning du même organisme, sa précision en raisonnement vocal atteint 99,7 %, également en tête. ASR affiche un taux d'erreur de mots de 1,7 % dans le classement de précision de reconnaissance vocale non streaming, à égalité en tête.

Cinq modèles, chacun son rôle

La répartition des tâches est, en gros, la suivante : Realtime prend en charge les conversations en temps réel en full-duplex, le modèle raisonnant directement sur le signal audio sans passer par une transcription textuelle ; ASR intègre la compréhension sémantique du grand modèle à l'étape de reconnaissance et, selon l'entreprise, peut traiter les dialectes, le mélange chinois-anglais et le vocabulaire technique spécialisé ; TTS réalise une synthèse quasi humaine qui, au-delà de la prononciation correcte, restitue des éléments paralinguistiques comme les pauses et l'intonation ; Gen réunit voix humaine, effets sonores, sons d'ambiance et musique de fond dans une seule interface de génération ; Music prend en charge la composition interactive sur plusieurs tours et permet de contrôler directement la mélodie via la notation ABC.

Parmi les cinq, celui qui demande le plus de savoir-faire est le « raisonnement vocal natif » de Realtime. La méthode traditionnelle convertit la voix en texte, raisonne sur ce texte, puis reconvertit le texte en voix ; dans cette chaîne en trois étapes, le ton, l'accentuation et l'émotion se perdent dès la première étape. Ce n'est qu'en supprimant cette étape de conversion que le modèle a une chance de comprendre si « tu le dis vraiment bien » est un compliment ou une pique.

L'annonce ne dit pas un mot sur l'ouverture ou non du code, ni sur la tarification.

Comment lire ce 1,7 %

Le taux d'erreur de mots de 1,7 % est un résultat obtenu en mode non streaming, et cette condition ne peut pas être omise. Le mode non streaming signifie que le modèle reçoit l'intégralité du segment audio avant de le transcrire, pouvant ainsi tenir compte du contexte avant et après ; le mode streaming exige de produire le texte au fur et à mesure de l'écoute, en ne voyant que ce qui est déjà passé, d'où un taux d'erreur généralement bien plus élevé. Mettre ces deux chiffres, issus de catégories différentes, côte à côte n'a pas de sens.

« À égalité en tête » est aussi une information en soi. Cela montre que cette position n'est pas exclusive — au moins un autre modèle s'arrête à la même décimale ; sur la reconnaissance non streaming, l'écart entre les meilleurs est déjà tombé au millième.

La véritable différenciation se joue probablement hors du classement : combien de dialectes sont couverts, avec quelle fluidité le passage d'une langue à l'autre se fait dans un discours mixte, si le vocabulaire technique nécessite une configuration supplémentaire. StepFun évoque ces points, mais sans fournir de chiffres comparables.

Ce que cela signifie pour les équipes chinoises

Cette année, la densité des modèles vocaux présentés publiquement en Chine n'est pas faible. Tencent Hunyuan a mis en open source le modèle AuK, Xiaomi a ouvert le code d'un modèle de reconnaissance multi-locuteurs, et le modèle vocal Tongyi d'Alibaba a intégré l'appel d'outils. La différence tient à la stratégie : les acteurs open source publient leurs poids pour que chacun puisse les modifier ; StepFun, de son côté, place ses cinq nouveaux modèles directement sur sa propre plateforme ouverte, accessibles via API — une barrière d'entrée plus basse pour les équipes qui ne comptent pas monter leur propre cluster d'inférence, au prix de faire tourner le modèle sur une machine appartenant à quelqu'un d'autre.

Pour les équipes qui développent des produits vocaux, ce qui détermine généralement l'adoption, ce sont trois autres questions : à combien de millisecondes peut-on ramener la latence de bout en bout de Realtime, le timbre de TTS est-il personnalisable, et les effets sonores générés par Gen disposent-ils d'une licence d'usage commercial. L'annonce ne précise aucun de ces trois points ; il faudra attendre la documentation de la plateforme ouverte.

Sources : annonce officielle de StepFun, classement Artificial Analysis, CocoLoop, ITHome ; les noms des cinq modèles, les critères de notation de Conversational Dynamics et Speech Reasoning, ainsi que le taux d'erreur de mots non streaming suivent l'annonce officielle et les pages de classement.