OpenAI refond ses agents vocaux avec trois modèles Realtime

OpenAI a présenté le 7 mai trois nouveaux modèles vocaux et a profondément remanié la ligne Realtime API. L'objectif est de réunir écoute, raisonnement, parole et appels d'outils dans une même conversation en direct.

La gamme comprend GPT-Realtime-2, un modèle conversationnel capable de raisonner tout en parlant; GPT-Realtime-Translate, pour l'interprétation en temps réel depuis 70 langues d'entrée vers 13 langues de sortie; et GPT-Realtime-Whisper, un modèle de transcription vocale en streaming. Les trois arrivent dans la version générale du Realtime API, avec la prise en charge des appels à des serveurs MCP distants, de l'entrée image et des appels téléphoniques SIP.

Realtime-2 vise la pause gênante de l'agent vocal

Le changement le plus important est la capacité de Realtime-2 à poursuivre l'échange pendant qu'il raisonne sur une demande. Beaucoup d'anciens agents vocaux fonctionnaient encore par étapes: l'utilisateur parlait, le système s'arrêtait, réfléchissait, puis répondait. Au téléphone, quelques secondes de silence donnent vite l'impression d'une ligne de support bloquée.

Realtime-2 est conçu pour répondre en raisonnant, garder le contexte lorsqu'un utilisateur l'interrompt et appeler plusieurs outils en parallèle. La fenêtre de contexte passe de 32K à 128K, et les développeurs peuvent ajuster l'intensité du raisonnement entre rapidité et analyse plus poussée. OpenAI décrit le modèle comme capable de faire avancer la conversation tout en utilisant des outils et en gérant corrections ou interruptions.

En clair, OpenAI veut qu'un agent téléphonique IA cesse de donner l'impression d'un conseiller trop lent.

Zillow et Deutsche Telekom servent de premiers exemples

OpenAI a mis en avant deux clients lors du lancement: Zillow et Deutsche Telekom. Zillow, grande plateforme immobilière américaine, a utilisé Realtime-2 sur du trafic téléphonique réel. OpenAI affirme que les taux de réussite des appels ont nettement progressé et que la robustesse en matière de conformité s'est améliorée, sans publier de pourcentage précis.

C'est significatif, car le blocage des agents vocaux ne se limitait pas à la reconnaissance des mots. La difficulté apparaissait souvent au tour suivant, lorsque le client combinait plusieurs contraintes: visiter un logement à 15 heures, mais terminer avant 16 heures pour récupérer sa fille, par exemple. Le test de Zillow suggère que Realtime-2 franchit mieux ce type de situation.

Deutsche Telekom teste Realtime-Translate pour le service client international, afin qu'un client germanophone et un conseiller anglophone puissent échanger sans interprète humain au milieu.

Les prix conviennent mieux à l'audio continu

GPT-Realtime-2 coûte 32 dollars par million de tokens d'entrée audio, 0,40 dollar pour l'entrée mise en cache et 64 dollars par million de tokens de sortie. GPT-Realtime-Translate coûte 0,034 dollar par minute, et GPT-Realtime-Whisper 0,017 dollar par minute.

La tarification à la minute de Translate et Whisper simplifie les budgets pour les centres d'appels, les comptes rendus de réunion et les autres usages audio continus: 1 000 minutes reviennent à 17 dollars avec Whisper ou 34 dollars avec Translate. Realtime-2 reste facturé au token, mais la forte remise sur l'entrée cache vise les applications qui réutilisent un grand prompt système dans chaque conversation, comme les agents de support.

La pile des agents vocaux se raccourcit

Au début de l'an dernier, l'IA vocale restait divisée par couches. ElevenLabs excellait dans le text-to-speech, Deepgram et Whisper dans le speech-to-text, et la première expérience vocale de GPT-4o souffrait encore de latence et de gestion des interruptions. OpenAI tente maintenant de compresser écouter, penser et parler dans une seule boucle de raisonnement.

La concurrence change donc de terrain. Il ne s'agit plus seulement de transcrire une conversation téléphonique avec précision, mais de faire en sorte que l'IA reprenne le prochain tour comme un humain en appel. ElevenLabs conserve un avantage en voice cloning, tandis qu'Anthropic n'a pas encore lancé cette année de modèle comparable sur une API vocale. Si les premiers chiffres de Zillow se confirment, les fournisseurs de SaaS de centres d'appels et les prestataires externalisés devront bientôt l'expliquer dans leurs propres résultats.

Sources: OpenAI has new voice models that reason,CocoLoop, translate, and transcribe as you speak (9to5Mac); OpenAI's New Voice API Models (StartupHub.ai); Advancing voice intelligence with new models in the API (blog officiel d'OpenAI)