OpenAI đưa ba mô hình giọng nói mới vào Realtime API

Ngày 7/5, OpenAI công bố ba mô hình giọng nói mới và gần như làm lại toàn bộ dòng Realtime API. Điểm chính là gom khả năng nghe, suy luận, nói và gọi công cụ vào cùng một cuộc hội thoại thời gian thực.

Ba mô hình gồm GPT-Realtime-2, mô hình hội thoại có thể suy luận trong lúc nói; GPT-Realtime-Translate, hỗ trợ dịch trực tiếp từ 70 ngôn ngữ đầu vào sang 13 ngôn ngữ đầu ra; và GPT-Realtime-Whisper, mô hình chuyển giọng nói thành văn bản theo luồng. Cả ba được đưa vào Realtime API bản chính thức, kèm hỗ trợ gọi máy chủ MCP từ xa, đầu vào hình ảnh và cuộc gọi SIP.

Realtime-2 nhắm vào khoảng lặng khi AI đang nghĩ

Điểm đáng chú ý nhất là Realtime-2 có thể giữ cuộc trò chuyện tiếp tục trong khi mô hình suy luận yêu cầu. Nhiều agent giọng nói trước đây hoạt động theo nhịp: người dùng nói xong, hệ thống dừng lại để nghĩ, rồi mới trả lời. Trong một cuộc gọi, vài giây im lặng đã đủ khiến người dùng cảm giác đường dây hỗ trợ bị đứng.

Realtime-2 được thiết kế để vừa suy luận vừa đáp lời, không mất ngữ cảnh khi người dùng ngắt lời, và có thể gọi nhiều công cụ song song. Cửa sổ ngữ cảnh tăng từ 32K lên 128K, còn nhà phát triển có thể điều chỉnh mức suy luận giữa phản hồi nhanh và xử lý kỹ hơn. OpenAI mô tả mô hình này là giữ cho cuộc trò chuyện tiếp diễn trong khi suy luận, gọi công cụ, xử lý chỉnh sửa hoặc ngắt lời.

Nói ngắn gọn, OpenAI muốn AI nghe điện thoại không còn giống một nhân viên chăm sóc khách hàng phản hồi chậm.

Zillow và Deutsche Telekom là hai ví dụ đầu tiên

OpenAI nêu hai khách hàng trong đợt ra mắt: Zillow và Deutsche Telekom. Zillow, nền tảng bất động sản lớn tại Mỹ, đã chạy Realtime-2 trên lưu lượng cuộc gọi thật. OpenAI nói tỷ lệ cuộc gọi thành công tăng đáng kể và độ vững về tuân thủ tốt hơn, nhưng không công bố phần trăm cụ thể.

Điều này đáng chú ý vì nút thắt của agent giọng nói không chỉ là nghe có chính xác hay không. Vấn đề thường nằm ở lượt trao đổi kế tiếp, khi khách hàng đưa ra nhiều ràng buộc cùng lúc, chẳng hạn hỏi có thể xem nhà lúc 3 giờ chiều nhưng phải kết thúc trước 4 giờ để đón con. Thử nghiệm của Zillow cho thấy Realtime-2 đang xử lý tốt hơn những tình huống nhiều điều kiện như vậy.

Deutsche Telekom đang thử Realtime-Translate cho dịch vụ khách hàng xuyên quốc gia, nơi khách nói tiếng Đức và nhân viên nói tiếng Anh có thể trao đổi mà không cần thông dịch viên ở giữa.

Cách tính giá cũng hợp với âm thanh liên tục hơn

GPT-Realtime-2 có giá 32 USD cho một triệu token âm thanh đầu vào, đầu vào đã cache là 0,40 USD, và 64 USD cho một triệu token đầu ra. GPT-Realtime-Translate có giá 0,034 USD mỗi phút, còn GPT-Realtime-Whisper là 0,017 USD mỗi phút.

Translate và Whisper chuyển sang tính theo phút giúp các kịch bản âm thanh kéo dài như tổng đài hoặc ghi biên bản họp dễ dự toán hơn: 1.000 phút tương ứng 17 USD với Whisper hoặc 34 USD với Translate. Realtime-2 vẫn tính theo token, nhưng mức giảm cho đầu vào cache phù hợp với các ứng dụng dùng lại một system prompt lớn trong mọi cuộc trò chuyện, chẳng hạn agent hỗ trợ khách hàng.

Ngăn xếp agent giọng nói đang được rút gọn

Đầu năm ngoái, thị trường AI giọng nói vẫn chia theo từng lớp. ElevenLabs mạnh về text-to-speech, Deepgram và Whisper tập trung vào speech-to-text, còn chế độ giọng nói thế hệ đầu của GPT-4o vẫn gặp vấn đề về độ trễ và xử lý ngắt lời. OpenAI giờ muốn nén nghe, nghĩ và nói vào cùng một vòng suy luận.

Vì vậy, cuộc cạnh tranh sẽ không chỉ là ai nhận dạng điện thoại chính xác hơn, mà là ai khiến AI bắt nhịp cuộc gọi như người thật. ElevenLabs có lợi thế voice cloning, còn Anthropic năm nay vẫn chưa tung mô hình đáng kể trên tuyến API giọng nói. Nếu dữ liệu ban đầu của Zillow giữ được, các công ty thuê ngoài chăm sóc khách hàng và SaaS call center sẽ sớm phải phản ánh sức ép đó trong kết quả kinh doanh.

Nguồn: OpenAI has new voice models that reason,CocoLoop, translate, and transcribe as you speak (9to5Mac); OpenAI's New Voice API Models (StartupHub.ai); Advancing voice intelligence with new models in the API (blog chính thức của OpenAI)