OpenAI ouvre l'API de GPT-Live-1, à 5 cents la minute

OpenAI a ouvert le modèle vocal GPT-Live-1 aux développeurs de l'API le 10 septembre. Le modèle avait d'abord fait ses débuts dans la fonction vocale de ChatGPT deux mois plus tôt, lorsque l'entreprise avait seulement indiqué que la version API arriverait « plus tard ». Les développeurs peuvent désormais l'utiliser directement pour créer des produits comme des services clients téléphoniques, des assistants vocaux ou des outils d'entraînement à l'oral.

GPT-Live-1 est un modèle full duplex : il écoute pendant que l'utilisateur parle, et il écoute aussi pendant qu'il parle lui-même — il peut être interrompu à tout moment et gère aussi bien le bruit de fond que les appels longs. Contrairement à la précédente génération Realtime, il n'a plus à tout résoudre seul. Face à une demande nécessitant du raisonnement ou l'appel d'un outil, il transmet la tâche à un modèle backend configuré par le développeur, se contentant de maintenir le rythme de la conversation.

Frontal et backend facturés séparément

Le prix suit lui aussi cette structure en deux parties. Le frontal vocal coûte 0,05 dollar par minute, facturé à la seconde près, sans arrondi au-dessus de la minute entamée ; les modèles et outils appelés côté backend sont facturés à part, à leur tarif habituel.

OpenAI propose trois associations types : pour les tâches simples et fréquentes comme la prise de rendez-vous ou les commandes, Luna ; pour les demandes de support plus complexes nécessitant du raisonnement, GPT-6 Astra ; pour les conversations liées au code, Codex. Des modèles tiers peuvent également être connectés en arrière-plan.

La documentation pour développeurs indique que le modèle se nomme gpt-live-1, qu'il passe par la nouvelle interface Live (v1/live/sessions) plutôt que par l'ancienne Realtime API ; l'entrée et la sortie prennent en charge l'audio et le texte, mais ni l'image ni la vidéo ; ses connaissances s'arrêtent au 31 juillet 2025. Le nombre maximal de sessions simultanées va de 25 à 500 selon le niveau de compte.

Face à face avec GPT-Realtime-2.1

Dans les chiffres de tests publiés par OpenAI, l'écart le plus important porte sur les indicateurs d'achèvement des tâches :

IndicateurGPT-Live-1GPT-Realtime-2.1
Intelligence vocale Tau3 (réussite du premier coup)86,2 %45,7 %
Interactivité full duplex80,1 %45,4 %
Réussite d'appel d'outil du premier coup87,0 %60,0 %
Latence de changement de tour de parole0,798 seconde1,41 seconde
Dynamique conversationnelle (Artificial Analysis)97,3 %95,7 %

Sur le naturel de la conversation, les deux générations ne diffèrent que de 1,6 point de pourcentage, la génération précédente étant déjà proche du maximum. Ce qui creuse l'écart, c'est la capacité à « accomplir réellement une tâche en discutant » : Tau3 comme les appels d'outils exigent que le modèle mène à bien un véritable processus métier au cours d'une conversation vocale. Sur le plan architectural, l'essentiel du progrès vient du fait que le raisonnement est délégué au backend, le frontal se contentant d'écouter et de parler. Le score Tau3 a été mesuré avec un modèle backend associé ; les documents officiels mentionnent la combinaison avec GPT-6 Astra. Le score obtenu avec un backend moins coûteux comme Luna n'a pas été communiqué séparément.

Les premiers retours clients

Les premiers clients cités par OpenAI sont Yelp, Speak, Fin et Cognition. Alex Levy, CTO de Yelp, a remarqué que les appelants se mettaient à formuler des phrases plus complètes :

"Callers are also speaking fuller, more natural sentences, which tells us the experience on the other end of the phone feels genuinely different."

Les appelants prononcent aussi des phrases plus complètes et plus naturelles, ce qui montre que l'expérience de l'autre côté du fil a vraiment changé.

Andrew Hsu, CTO de l'application d'apprentissage des langues Speak, a donné un chiffre : lorsque l'utilisateur s'arrête pour chercher un mot, le modèle l'interrompt environ 80 % moins souvent que les systèmes classiques à tour de parole. Jordan Neil, COO de l'entreprise de support client Fin, décrit un service vocal passé d'un rythme « question puis pause » à quelque chose de proche d'un appel téléphonique normal. De son côté, Cognition a connecté le modèle à Devin, permettant aux ingénieurs de discuter à voix haute des solutions avec l'agent de programmation.

L'audio généré porte un filigrane SynthID. Seul un petit choix de voix est disponible pour l'instant ; les voix personnalisées nécessitent de contacter l'équipe commerciale.

Les performances en chinois sont la partie qui n'a pas été dévoilée cette fois. OpenAI a seulement indiqué que la prise en charge des langues et des accents s'étendrait dans les mois à venir, sans fournir de liste de langues. Les équipes qui développent un support téléphonique en chinois devront faire leurs propres tests avant de décider de basculer.

Sources : annonce officielle et documentation pour développeurs d'OpenAI (vérification des tarifs, de l'interface et des limites de simultanéité), Unite.AI, CocoLoop, déclarations publiques de clients comme Yelp et Speak ; tous les résultats de tests correspondent aux chiffres publiés par OpenAI.