OpenAI refaz agentes de voz com três modelos Realtime

A OpenAI apresentou em 7 de maio três novos modelos de voz e reorganizou a linha do Realtime API. A proposta é colocar escuta, raciocínio, fala e chamadas de ferramentas dentro de uma mesma conversa ao vivo.

Os modelos são o GPT-Realtime-2, voltado a conversas em que o sistema raciocina enquanto fala; o GPT-Realtime-Translate, para interpretação em tempo real de 70 idiomas de entrada para 13 idiomas de saída; e o GPT-Realtime-Whisper, para transcrição de voz em streaming. Os três entram na versão geral do Realtime API, junto com chamadas a servidores MCP remotos, entrada de imagens e chamadas telefônicas via SIP.

Realtime-2 tenta remover a pausa de quem está pensando

A mudança central é a capacidade do Realtime-2 de manter a conversa andando enquanto raciocina sobre um pedido. Muitos agentes de voz antigos seguiam um padrão ruim: o usuário falava, o sistema parava, pensava e só então respondia. Em uma ligação, alguns segundos de silêncio já parecem uma central de atendimento travada.

O Realtime-2 foi desenhado para responder enquanto raciocina, manter o contexto quando o usuário interrompe e chamar várias ferramentas em paralelo. A janela de contexto passou de 32K para 128K, e o desenvolvedor pode ajustar a intensidade do raciocínio entre velocidade e análise mais profunda. Segundo a OpenAI, o modelo mantém a conversa fluindo enquanto usa ferramentas e lida com correções ou interrupções.

Na prática, a promessa é fazer um agente telefônico de IA soar menos como um atendente lento.

Zillow e Deutsche Telekom aparecem como casos iniciais

A OpenAI destacou dois clientes no lançamento: Zillow e Deutsche Telekom. A Zillow, grande plataforma imobiliária dos EUA, usou o Realtime-2 em tráfego real de chamadas por algum tempo. A OpenAI afirma que houve melhora significativa nas taxas de sucesso das ligações e maior robustez de conformidade, mas não divulgou percentuais.

Isso importa porque o gargalo dos agentes de voz nunca foi apenas entender as palavras. O problema surgia na rodada seguinte, quando o cliente trazia várias restrições ao mesmo tempo, como visitar um imóvel às 15h e terminar antes das 16h por causa da saída da filha da escola. O teste da Zillow sugere que o Realtime-2 passa melhor por esse tipo de situação.

A Deutsche Telekom testa o Realtime-Translate para atendimento internacional, permitindo que um cliente fale alemão e um atendente fale inglês sem um intérprete humano no meio.

A cobrança ficou mais simples para áudio contínuo

O GPT-Realtime-2 custa US$ 32 por milhão de tokens de entrada de áudio, US$ 0,40 para entrada em cache e US$ 64 por milhão de tokens de saída. O GPT-Realtime-Translate custa US$ 0,034 por minuto, e o GPT-Realtime-Whisper, US$ 0,017 por minuto.

A cobrança por minuto em Translate e Whisper facilita o cálculo para call centers, atas de reunião e outros usos de áudio contínuo: 1.000 minutos saem por US$ 17 no Whisper ou US$ 34 no Translate. O Realtime-2 continua baseado em tokens, mas o desconto de cache mira aplicações que reutilizam um grande prompt de sistema em toda conversa, como agentes de suporte.

A pilha de agentes de voz está encolhendo

No início do ano passado, a IA de voz ainda era dividida em camadas. A ElevenLabs se destacava em text-to-speech, Deepgram e Whisper em speech-to-text, e a primeira geração de voz do GPT-4o ainda sofria com latência e interrupções. Agora, a OpenAI tenta comprimir ouvir, pensar e falar em um único processo de raciocínio.

A disputa muda de foco. Não basta transcrever uma ligação com mais precisão; é preciso fazer a IA sustentar a próxima fala como uma pessoa em uma chamada ao vivo. A ElevenLabs mantém vantagem em voice cloning, enquanto a Anthropic ainda não lançou um modelo relevante nessa linha de API de voz este ano. Se os primeiros dados da Zillow se confirmarem, fornecedores de SaaS para call center e empresas de atendimento terceirizado logo terão de explicar esse impacto nos próprios números.

Fontes: OpenAI has new voice models that reason,CocoLoop, translate, and transcribe as you speak (9to5Mac); OpenAI's New Voice API Models (StartupHub.ai); Advancing voice intelligence with new models in the API (blog oficial da OpenAI)