OpenAI abrió el modelo de voz GPT-Live-1 a los desarrolladores de la API el 10 de septiembre. El modelo había debutado dos meses antes en la función de voz de ChatGPT, cuando la empresa solo dijo que la versión de API llegaría "más adelante". Ahora los desarrolladores pueden usarlo directamente para crear productos como atención telefónica, asistentes de voz o práctica de conversación.
GPT-Live-1 es un modelo full-duplex: mientras el usuario habla, está escuchando, y mientras él habla, también está escuchando; puede ser interrumpido en cualquier momento y gestiona bien el ruido de fondo y las llamadas largas. A diferencia de la generación Realtime anterior, ya no tiene que resolverlo todo por sí mismo. Ante solicitudes que requieren razonamiento o el uso de herramientas, traspasa la tarea a un modelo de back-end configurado por el desarrollador y se limita a mantener el ritmo de la conversación.
Front-end y back-end con cobro separado
El precio también se divide en dos partes según esta estructura. El front-end de voz cuesta 0,05 dólares por minuto, facturado por segundo, sin redondear al minuto completo; los modelos y herramientas invocados en el back-end se cobran aparte, a su precio habitual.
OpenAI ofrece tres combinaciones sugeridas: tareas simples y frecuentes, como agendar citas o hacer pedidos, con Luna; consultas de atención al cliente más complejas que requieren razonamiento, con GPT-6 Astra; y conversaciones relacionadas con código conectadas a Codex. También se pueden conectar modelos de terceros en el back-end.
La documentación para desarrolladores muestra que el nombre del modelo es gpt-live-1, que utiliza la nueva interfaz Live (v1/live/sessions) en lugar de la antigua Realtime API; la entrada y salida admiten audio y texto, pero no imagen ni video; el conocimiento llega hasta el 31 de julio de 2025. El límite de sesiones simultáneas va de 25 a 500 según el nivel de cuenta.
Comparativa punto por punto con GPT-Realtime-2.1
En las cifras de las pruebas publicadas por OpenAI, la mayor diferencia aparece en las métricas de finalización de tareas:
| Métrica | GPT-Live-1 | GPT-Realtime-2.1 |
|---|---|---|
| Inteligencia de voz Tau3 (acierto a la primera) | 86,2% | 45,7% |
| Interactividad full-duplex | 80,1% | 45,4% |
| Acierto de llamada a herramientas a la primera | 87,0% | 60,0% |
| Latencia en el cambio de turno | 0,798 segundos | 1,41 segundos |
| Dinámica de conversación (Artificial Analysis) | 97,3% | 95,7% |
En cuanto a la naturalidad de la conversación, las dos generaciones difieren solo en 1,6 puntos porcentuales, ya que la generación anterior ya estaba cerca del máximo. Lo que abre la brecha es la capacidad de "resolver tareas mientras se conversa": tanto Tau3 como las llamadas a herramientas exigen que el modelo complete un flujo de trabajo real dentro de la conversación de voz. Desde el punto de vista de la arquitectura, gran parte de la mejora proviene de delegar el razonamiento al back-end, dejando que el front-end solo se encargue de escuchar y hablar. La puntuación de Tau3 se midió con un modelo de back-end conectado; el material oficial menciona la combinación con GPT-6 Astra. Cuánto puntuaría con un back-end más económico como Luna no se ha revelado por separado.
Reacciones de los primeros clientes
Los primeros clientes mencionados por OpenAI son Yelp, Speak, Fin y Cognition. El CTO de Yelp, Alex Levy, notó que quienes llaman empezaron a hablar con frases más completas:
"Callers are also speaking fuller, more natural sentences, which tells us the experience on the other end of the phone feels genuinely different."
Quienes llaman están hablando con frases más completas y naturales, lo que indica que la experiencia al otro lado de la línea realmente ha cambiado.
Andrew Hsu, CTO de la aplicación de aprendizaje de idiomas Speak, dio una cifra: cuando el usuario se detiene a pensar una palabra, el modelo interrumpe alrededor de un 80% menos que los sistemas de conversación por turnos tradicionales. Jordan Neil, COO de la empresa de atención al cliente Fin, describe que el soporte de voz pasó de un patrón de "pregunta y pausa" a un ritmo cercano al de una llamada telefónica normal. Cognition, por su parte, conectó el modelo a Devin, permitiendo que los ingenieros hablen mientras diseñan soluciones junto al agente de programación.
El audio generado lleva una marca de agua SynthID. Por ahora solo hay disponible un pequeño conjunto de voces; para voces personalizadas hay que contactar al equipo de ventas.
El rendimiento en chino es la parte que no se ha revelado esta vez. OpenAI solo indicó que el soporte de idiomas y acentos se ampliará en los próximos meses, sin dar una lista de idiomas. Los equipos que ofrecen atención telefónica en chino deberán hacer sus propias pruebas antes de decidir si cambian.
Fuentes: anuncio oficial y documentación para desarrolladores de OpenAI (verificación de precios, interfaz y límites de simultaneidad), Unite.AI, CocoLoop, declaraciones públicas de clientes como Yelp y Speak; todos los resultados de las pruebas siguen las cifras publicadas por OpenAI.