OpenAI abre API do GPT-Live-1, a 5 centavos por minuto

A OpenAI liberou o modelo de voz GPT-Live-1 para desenvolvedores de API em 10 de setembro. O modelo havia estreado dois meses antes na função de voz do ChatGPT, quando a empresa disse apenas que a versão de API seria aberta "mais adiante". Agora os desenvolvedores podem usá-lo diretamente para criar produtos como atendimento telefônico, assistentes de voz e prática de conversação.

O GPT-Live-1 é um modelo full-duplex: enquanto o usuário fala, ele está ouvindo, e enquanto ele fala, também está ouvindo — pode ser interrompido a qualquer momento e lida bem com ruído de fundo e chamadas longas. Diferente da geração Realtime anterior, ele não precisa resolver tudo sozinho. Em pedidos que exigem raciocínio ou uso de ferramentas, ele repassa a tarefa a um modelo de back-end configurado pelo desenvolvedor, mantendo por conta própria apenas o ritmo da conversa.

Front-end e back-end com cobrança separada

O preço também segue essa divisão em duas partes. O front-end de voz custa 0,05 dólares por minuto, cobrado por segundo, sem arredondar para o minuto cheio; os modelos e ferramentas chamados no back-end são cobrados à parte, pelo preço normal de cada um.

A OpenAI sugere três combinações: tarefas simples e frequentes, como agendamentos e pedidos, com Luna; questões de atendimento mais complexas, que exigem raciocínio, com GPT-6 Astra; e conversas relacionadas a código conectadas ao Codex. Modelos de terceiros também podem ser conectados no back-end.

A documentação para desenvolvedores mostra que o nome do modelo é gpt-live-1, que ele usa a nova interface Live (v1/live/sessions) em vez da antiga Realtime API; a entrada e a saída suportam áudio e texto, mas não imagem nem vídeo; o conhecimento vai até 31 de julho de 2025. O limite de sessões simultâneas varia de 25 a 500, dependendo do nível da conta.

Comparação item a item com o GPT-Realtime-2.1

Nos números de teste divulgados pela OpenAI, a maior diferença aparece nas métricas de conclusão de tarefas:

MétricaGPT-Live-1GPT-Realtime-2.1
Inteligência de voz Tau3 (acerto na primeira tentativa)86,2%45,7%
Interatividade full-duplex80,1%45,4%
Acerto de chamada de ferramenta na primeira tentativa87,0%60,0%
Latência na troca de turno0,798 segundos1,41 segundos
Dinâmica de conversa (Artificial Analysis)97,3%95,7%

No item de naturalidade da conversa, as duas gerações diferem apenas 1,6 ponto percentual, já que a geração anterior estava perto do máximo. O que abre a diferença é a capacidade de "resolver tarefas enquanto conversa": tanto o Tau3 quanto as chamadas de ferramentas exigem que o modelo conclua um fluxo de trabalho real dentro da conversa por voz. Do ponto de vista de arquitetura, boa parte do avanço vem de transferir o raciocínio para o back-end, deixando o front-end responsável apenas por ouvir e falar. A pontuação do Tau3 foi medida com um modelo de back-end conectado; o material oficial cita a combinação com o GPT-6 Astra. Quanto pontuaria com um back-end mais barato, como o Luna, a OpenAI não divulgou separadamente.

Retorno dos primeiros clientes

Os primeiros clientes citados pela OpenAI são Yelp, Speak, Fin e Cognition. O CTO do Yelp, Alex Levy, notou que quem liga começou a falar frases mais completas:

"Callers are also speaking fuller, more natural sentences, which tells us the experience on the other end of the phone feels genuinely different."

Quem liga está falando frases mais completas e naturais, o que mostra que a experiência do outro lado da linha realmente mudou.

Andrew Hsu, CTO do aplicativo de aprendizado de idiomas Speak, deu um número: quando o usuário para para pensar em uma palavra, o modelo interrompe cerca de 80% menos do que sistemas de conversa por turnos tradicionais. Jordan Neil, COO da empresa de atendimento Fin, descreve que o suporte por voz passou de um padrão de "pergunta e pausa" para um ritmo próximo ao de uma ligação telefônica normal. Já a Cognition conectou o modelo ao Devin, permitindo que engenheiros discutam soluções em voz alta junto com o agente de programação.

O áudio gerado traz marca d'água SynthID. Por enquanto, há apenas um pequeno conjunto de vozes disponíveis; vozes personalizadas exigem contato com a equipe comercial.

O desempenho em chinês é a parte que não foi divulgada desta vez. A OpenAI disse apenas que o suporte a idiomas e sotaques será ampliado nos próximos meses, sem apresentar uma lista de idiomas. Equipes que fazem atendimento telefônico em chinês devem testar por conta própria antes de decidir migrar.

Fontes: anúncio oficial e documentação para desenvolvedores da OpenAI (verificação de preços, interface e limites de simultaneidade), Unite.AI, CocoLoop, declarações públicas de clientes como Yelp e Speak; todos os resultados de teste seguem os números divulgados pela OpenAI.