OpenAI가 5월 7일 음성 모델 3종을 공개하며 Realtime API 제품군을 전면 개편했다. 목표는 듣기, 추론, 말하기, 도구 호출을 실시간 대화 안에서 하나의 흐름으로 묶는 것이다.
새 모델은 말하면서 추론하는 대화 모델 GPT-Realtime-2, 70개 입력 언어와 13개 출력 언어를 지원하는 실시간 통역 모델 GPT-Realtime-Translate, 스트리밍 음성-텍스트 변환 모델 GPT-Realtime-Whisper다. 세 모델은 Realtime API 정식 버전에 들어가며, 원격 MCP 서버 호출, 이미지 입력, SIP 전화 수신도 함께 지원한다.
Realtime-2는 통화 중 어색한 정적을 줄인다
핵심은 Realtime-2가 요청을 추론하는 동안에도 대화를 이어갈 수 있다는 점이다. 기존 음성 에이전트는 사용자가 말을 끝낸 뒤 잠시 멈추고, 생각한 다음 답하는 방식이 많았다. 전화에서는 몇 초의 지연만으로도 상대가 멈춘 상담 시스템처럼 느껴진다.
Realtime-2는 대화를 끊지 않고 응답하고, 사용자가 중간에 끼어들어도 문맥을 잃지 않으며, 여러 도구를 병렬로 호출할 수 있다. 컨텍스트 창은 이전 32K에서 128K로 커졌고, 개발자는 빠른 응답과 더 깊은 추론 사이에서 추론 강도를 조절할 수 있다. OpenAI는 이 모델이 도구를 호출하고 수정이나 끼어들기를 처리하면서 대화를 계속 움직이게 한다고 설명했다.
쉽게 말해, AI가 전화를 받을 때 더는 반응이 느린 고객센터 상담원처럼 들리지 않게 하겠다는 것이다.
Zillow와 Deutsche Telekom이 초기 사례로 등장
OpenAI는 이번 발표에서 Zillow와 Deutsche Telekom을 주요 고객 사례로 언급했다. 미국 대형 부동산 플랫폼 Zillow는 Realtime-2를 실제 전화 트래픽에서 일정 기간 사용했다. OpenAI는 통화 성공률이 크게 개선됐고 컴플라이언스 안정성도 좋아졌다고 설명했지만, 구체적인 수치는 공개하지 않았다.
이 사례가 중요한 이유는 음성 에이전트의 병목이 단순한 인식률이 아니었기 때문이다. “오후 3시에 집을 볼 수 있나, 딸 하교 때문에 4시 전에는 끝내야 한다” 같은 조건이 여러 개인 질문에서 이전 세대 모델은 다음 대화를 이어받지 못하는 경우가 많았다. Zillow의 테스트는 Realtime-2가 이런 지점을 더 잘 처리하고 있음을 시사한다.
Deutsche Telekom은 Realtime-Translate를 다국적 고객지원에 시험 중이다. 독일어를 쓰는 고객과 영어를 쓰는 상담원이 사람 통역 없이 대화하는 상황을 염두에 둔 것이다.
가격은 연속 음성 업무에 맞게 정리됐다
GPT-Realtime-2는 오디오 입력 100만 토큰당 32달러, 캐시 입력은 0.40달러, 출력 100만 토큰당 64달러다. GPT-Realtime-Translate는 분당 0.034달러, GPT-Realtime-Whisper는 분당 0.017달러다.
Translate와 Whisper가 분 단위 과금으로 바뀌면서 고객센터나 회의록처럼 긴 음성을 계속 처리하는 업무의 비용 계산이 쉬워졌다. 1,000분이면 Whisper는 17달러, Translate는 34달러다. Realtime-2는 여전히 토큰 과금이지만, 대형 시스템 프롬프트를 매 대화마다 재사용하는 지원 에이전트에는 캐시 입력 할인이 크게 작용한다.
음성 에이전트 스택이 하나로 줄어든다
작년 초만 해도 음성 AI 시장은 역할이 나뉘어 있었다. ElevenLabs는 음성 합성, Deepgram과 Whisper는 음성 인식, GPT-4o 1세대 음성 모드는 대화 경험을 맡았지만 지연과 끊김 처리에서 약점이 있었다. OpenAI는 이제 듣고, 생각하고, 말하는 과정을 하나의 추론 루프로 압축하려 한다.
경쟁 기준도 달라진다. 앞으로는 전화 내용을 누가 더 정확히 받아쓰느냐보다, AI가 실제 통화에서 사람처럼 다음 말을 이어받을 수 있느냐가 더 중요해진다. ElevenLabs에는 보이스 클로닝의 강점이 있고, Anthropic은 올해 아직 음성 API 라인에서 뚜렷한 모델을 내놓지 않았다. Zillow의 초기 데이터가 유지된다면 콜센터 SaaS와 외주 상담 업체들도 곧 숫자로 압박을 받게 될 수 있다.
출처: OpenAI has new voice models that reason,CocoLoop, translate, and transcribe as you speak(9to5Mac); OpenAI's New Voice API Models(StartupHub.ai); Advancing voice intelligence with new models in the API(OpenAI 공식 블로그)