OpenAI presentó el 7 de mayo tres nuevos modelos de voz y reorganizó por completo la línea del Realtime API. La idea es unir escucha, razonamiento, habla y llamadas a herramientas dentro de una conversación en vivo.
La lista incluye GPT-Realtime-2, un modelo conversacional capaz de razonar mientras habla; GPT-Realtime-Translate, para interpretación en tiempo real desde 70 idiomas de entrada hacia 13 de salida; y GPT-Realtime-Whisper, un modelo de voz a texto en streaming. Los tres llegan a la versión general del Realtime API, junto con llamadas a servidores MCP remotos, entrada de imágenes y llamadas telefónicas SIP.
Realtime-2 ataca la pausa incómoda del agente
El cambio central es que Realtime-2 puede mantener la conversación mientras razona sobre una solicitud. Muchos agentes de voz anteriores seguían un patrón torpe: el usuario terminaba de hablar, el sistema se detenía, pensaba y luego respondía. En una llamada, unos segundos de silencio bastan para que parezca una línea de soporte rota.
Realtime-2 está diseñado para responder mientras razona, conservar el contexto cuando el usuario interrumpe y llamar varias herramientas en paralelo. La ventana de contexto sube de 32K a 128K, y los desarrolladores pueden ajustar la intensidad del razonamiento entre velocidad y análisis más profundo. OpenAI lo describe como un modelo que mantiene la conversación en movimiento mientras usa herramientas y gestiona correcciones o interrupciones.
En términos simples, OpenAI quiere que un agente telefónico de IA deje de sonar como un operador lento.
Zillow y Deutsche Telekom son las primeras señales
OpenAI destacó dos clientes en el lanzamiento: Zillow y Deutsche Telekom. Zillow, una gran plataforma inmobiliaria de Estados Unidos, ha usado Realtime-2 con tráfico telefónico real. OpenAI afirma que las tasas de éxito de las llamadas mejoraron de forma notable y que la solidez en cumplimiento fue mayor, aunque no publicó porcentajes.
El dato importa porque el cuello de botella de los agentes de voz no era solo reconocer palabras. El problema aparecía en el siguiente turno, cuando el cliente añadía varias restricciones a la vez, por ejemplo ver una vivienda a las 3 de la tarde pero terminar antes de las 4 por la salida de su hija del colegio. La prueba de Zillow sugiere que Realtime-2 supera mejor ese tipo de situaciones.
Deutsche Telekom prueba Realtime-Translate para atención internacional, de modo que un cliente que habla alemán y un agente que habla inglés puedan conversar sin un intérprete humano de por medio.
La tarifa se adapta mejor al audio continuo
GPT-Realtime-2 cuesta 32 dólares por millón de tokens de entrada de audio, 0,40 dólares por entrada en caché y 64 dólares por millón de tokens de salida. GPT-Realtime-Translate cuesta 0,034 dólares por minuto, y GPT-Realtime-Whisper, 0,017 dólares por minuto.
La facturación por minuto de Translate y Whisper simplifica el cálculo para centros de llamadas, actas de reuniones y otros usos de audio continuo: 1.000 minutos equivalen a 17 dólares con Whisper o 34 dólares con Translate. Realtime-2 sigue cobrando por tokens, pero el fuerte descuento en entrada cacheada está pensado para aplicaciones que reutilizan un gran prompt de sistema en cada conversación, como agentes de soporte.
La pila de agentes de voz se está reduciendo
A comienzos del año pasado, la IA de voz todavía estaba partida en capas. ElevenLabs destacaba en text-to-speech, Deepgram y Whisper en speech-to-text, y la primera experiencia de voz de GPT-4o aún sufría con la latencia y las interrupciones. OpenAI intenta ahora comprimir escuchar, pensar y hablar en un solo proceso de razonamiento.
Eso cambia la competencia. Ya no se trata solo de quién transcribe mejor una llamada, sino de quién consigue que la IA responda al siguiente turno como una persona en una conversación telefónica. ElevenLabs conserva ventaja en voice cloning, mientras Anthropic aún no ha lanzado este año un modelo comparable en la línea de API de voz. Si los primeros datos de Zillow se mantienen, las empresas de outsourcing de atención y los SaaS de call center tendrán que reflejar pronto esa presión en sus propios resultados.
Fuentes: OpenAI has new voice models that reason,CocoLoop, translate, and transcribe as you speak (9to5Mac); OpenAI's New Voice API Models (StartupHub.ai); Advancing voice intelligence with new models in the API (blog oficial de OpenAI)