OpenAI가 9월 10일 음성 모델 GPT-Live-1을 API 개발자에게 공개했다. 이 모델은 두 달 전 ChatGPT 음성 기능에 먼저 도입됐고, 당시 회사는 API 버전은 "추후 공개"라고만 밝혔다. 이제 개발자는 전화 상담, 음성 비서, 회화 연습 같은 서비스에 이 모델을 직접 붙일 수 있다.
GPT-Live-1은 전이중(full-duplex) 모델로, 사용자가 말하는 동안에도, 자신이 말하는 동안에도 계속 듣고 있어 언제든 끼어들기가 가능하고 배경 소음이나 장시간 통화도 처리한다. 이전 세대인 Realtime 시리즈와 달리 모든 판단을 스스로 내리는 구조가 아니다. 추론이나 도구 호출이 필요한 요청은 개발자가 설정한 백엔드 모델에 넘기고, 자신은 대화의 흐름을 유지하는 데 집중한다.
프런트엔드와 백엔드는 요금이 따로 매겨진다
가격 체계도 이 구조를 따라 두 갈래로 나뉜다. 음성 프런트엔드는 분당 0.05달러이며 초 단위로 과금돼 1분 미만도 반올림해 청구하지 않는다. 백엔드에서 호출하는 모델과 도구는 각자의 정상 요금이 별도로 부과된다.
OpenAI가 제시한 조합은 세 가지다. 예약·주문처럼 빈도는 높지만 단순한 작업에는 Luna, 추론이 필요한 복잡한 상담에는 GPT-6 Astra, 코드 관련 대화에는 Codex를 붙이라는 것이다. 서드파티 모델을 백엔드에 연결하는 것도 가능하다.
개발자 문서에 따르면 모델명은 gpt-live-1이며 기존 Realtime API가 아닌 새로운 Live 엔드포인트(v1/live/sessions)를 사용한다. 입출력은 오디오와 텍스트를 지원하고 이미지·영상은 지원하지 않으며, 지식 컷오프는 2025년 7월 31일이다. 동시 세션 상한은 계정 등급에 따라 25개에서 500개까지 차이가 있다.
GPT-Realtime-2.1과 항목별 비교
OpenAI가 공개한 테스트 수치에서 격차가 가장 큰 항목은 작업 완수 관련 지표다.
| 지표 | GPT-Live-1 | GPT-Realtime-2.1 |
|---|---|---|
| Tau3 음성 지능(1회 성공률) | 86.2% | 45.7% |
| 전이중 상호작용성 | 80.1% | 45.4% |
| 도구 호출 1회 성공률 | 87.0% | 60.0% |
| 턴 전환 지연 | 0.798초 | 1.41초 |
| Artificial Analysis 대화 역동성 | 97.3% | 95.7% |
대화의 자연스러움 항목에서는 두 세대 차이가 1.6포인트에 불과한데, 이전 세대가 이미 만점에 가까웠기 때문이다. 격차가 벌어진 곳은 "대화하면서 실제로 일을 처리하는" 부분이다. Tau3와 도구 호출 두 항목 모두 음성 대화 중에 실제 업무 흐름을 끝까지 완수할 것을 요구한다. 구조적으로 보면 이번 향상은 상당 부분 추론을 백엔드로 넘긴 데서 온다. 프런트엔드는 듣고 말하는 데만 집중한다. Tau3 점수는 백엔드 모델을 붙인 상태에서 측정됐으며, 공개 자료가 언급한 조합은 GPT-6 Astra다. Luna처럼 저렴한 백엔드로 바꿨을 때 점수가 얼마나 나오는지는 별도로 공개되지 않았다.
초기 고객들의 반응
OpenAI가 언급한 초기 고객은 Yelp, Speak, Fin, Cognition 네 곳이다. Yelp의 최고기술책임자(CTO) Alex Levy는 전화를 건 이용자들이 더 완결된 문장으로 말하기 시작했다는 점을 주목했다.
"Callers are also speaking fuller, more natural sentences, which tells us the experience on the other end of the phone feels genuinely different."
(전화를 건 이용자들이 더 완전하고 자연스러운 문장으로 말한다는 것은, 전화 저편의 경험이 실제로 달라졌다는 뜻이라는 취지다.)
언어 학습 앱 Speak의 CTO Andrew Hsu는 구체적인 수치를 제시했다. 사용자가 단어를 고르느라 말을 멈췄을 때 모델이 끼어드는 경우가, 순서 교대 방식 시스템에 비해 약 80% 줄었다는 것이다. 상담 기업 Fin의 COO Jordan Neil은 음성 상담이 "묻고 멈추는" 방식에서 일반 전화에 가까운 리듬으로 바뀌었다고 표현했다. Cognition은 이 모델을 코딩 에이전트 Devin에 연결해, 엔지니어가 말하면서 에이전트와 방안을 조율할 수 있게 했다.
생성되는 오디오에는 SynthID 워터마크가 삽입된다. 음성 종류는 아직 소수만 제공되며, 커스텀 음성을 쓰려면 영업팀에 문의해야 한다.
이번에 공개되지 않은 부분은 중국어 성능이다. OpenAI는 언어·억양 지원을 앞으로 몇 달에 걸쳐 순차적으로 확대하겠다고만 밝혔을 뿐, 구체적인 언어 목록은 내놓지 않았다. 중국어 전화 상담을 운영하는 팀이라면 전환 전에 직접 테스트를 돌려봐야 한다.
참고 출처: 가격·API·동시 접속 상한 확인용 OpenAI 공식 발표 및 개발자 문서, Unite.AI, CocoLoop, Yelp와 Speak 등 고객의 공개 발언; 테스트 점수는 모두 OpenAI가 공개한 수치를 따른다.