OpenAI đã mở mô hình giọng nói GPT-Live-1 cho các nhà phát triển API vào ngày 10 tháng 9. Mô hình này ra mắt lần đầu trong tính năng giọng nói của ChatGPT hai tháng trước, khi đó OpenAI chỉ cho biết phiên bản API sẽ "được mở sau". Giờ đây các nhà phát triển có thể dùng trực tiếp mô hình này để xây dựng các sản phẩm như tổng đài chăm sóc khách hàng, trợ lý giọng nói và luyện nói.
GPT-Live-1 là mô hình song công hoàn toàn: khi người dùng nói, nó đang lắng nghe; khi nó nói, nó cũng đang lắng nghe, có thể bị ngắt lời bất cứ lúc nào, đồng thời xử lý được tiếng ồn nền và các cuộc gọi kéo dài. Khác với dòng Realtime trước đây, nó không tự mình xử lý mọi việc. Với các yêu cầu cần suy luận hoặc gọi công cụ, nó chuyển nhiệm vụ cho mô hình back-end mà nhà phát triển đã cấu hình, còn bản thân nó tiếp tục duy trì nhịp điệu cuộc trò chuyện.
Front-end và back-end tính phí riêng
Giá cũng được chia thành hai phần theo cấu trúc này. Phần giọng nói front-end tính phí 0,05 đô la mỗi phút, tính theo giây, chưa đủ một phút cũng không bị làm tròn lên; các mô hình và công cụ được gọi ở back-end tính riêng theo giá thông thường của chúng.
OpenAI đưa ra ba gợi ý kết hợp: các tác vụ đơn giản và tần suất cao như xếp lịch, đặt hàng thì ghép với Luna; các vấn đề chăm sóc khách hàng phức tạp cần suy luận thì ghép với GPT-6 Astra; các cuộc trò chuyện liên quan đến lập trình thì nối với Codex. Các mô hình của bên thứ ba cũng có thể được gắn vào phía sau.
Tài liệu dành cho nhà phát triển cho thấy tên mô hình là gpt-live-1, sử dụng giao diện Live mới (v1/live/sessions), không đi qua Realtime API cũ; đầu vào và đầu ra hỗ trợ âm thanh và văn bản, không hỗ trợ hình ảnh và video; kiến thức được cập nhật đến ngày 31 tháng 7 năm 2025. Giới hạn số phiên đồng thời dao động từ 25 đến 500, tùy theo hạng tài khoản.
So sánh từng chỉ số với GPT-Realtime-2.1
Trong các con số kiểm định mà OpenAI công bố, khoảng cách lớn nhất nằm ở các chỉ số hoàn thành tác vụ:
| Chỉ số | GPT-Live-1 | GPT-Realtime-2.1 |
|---|---|---|
| Trí tuệ giọng nói Tau3 (tỷ lệ vượt qua lần đầu) | 86,2% | 45,7% |
| Tính tương tác song công hoàn toàn | 80,1% | 45,4% |
| Tỷ lệ gọi công cụ thành công lần đầu | 87,0% | 60,0% |
| Độ trễ chuyển lượt nói | 0,798 giây | 1,41 giây |
| Artificial Analysis - động lực hội thoại | 97,3% | 95,7% |
Ở chỉ số tự nhiên trong hội thoại, hai thế hệ chỉ chênh nhau 1,6 điểm phần trăm, vì thế hệ trước đã gần đạt điểm tối đa. Điều tạo ra khoảng cách là khả năng "vừa trò chuyện vừa hoàn thành công việc": cả Tau3 và gọi công cụ đều đòi hỏi mô hình đi hết một quy trình nghiệp vụ thực sự trong khi đang trò chuyện bằng giọng nói. Xét về kiến trúc, phần lớn cải thiện đến từ việc chuyển suy luận cho back-end, còn front-end chỉ lo nghe và nói. Điểm số Tau3 này được đo khi ghép với một mô hình back-end cụ thể; tài liệu chính thức nhắc đến tổ hợp là GPT-6 Astra. Nếu đổi sang một back-end rẻ hơn như Luna thì đạt bao nhiêu điểm, OpenAI không công bố riêng.
Phản hồi từ khách hàng sớm
Các khách hàng sớm mà OpenAI nêu tên gồm Yelp, Speak, Fin và Cognition. Giám đốc công nghệ (CTO) của Yelp, Alex Levy, nhận thấy người gọi điện bắt đầu nói những câu trọn vẹn hơn:
"Callers are also speaking fuller, more natural sentences, which tells us the experience on the other end of the phone feels genuinely different."
Người gọi đang nói những câu trọn vẹn và tự nhiên hơn, điều đó cho thấy trải nghiệm ở đầu dây bên kia thực sự đã khác.
CTO của ứng dụng học ngôn ngữ Speak, Andrew Hsu, đưa ra một con số: khi người dùng dừng lại để nghĩ từ, mô hình chen ngang ít hơn khoảng 80% so với các hệ thống trò chuyện theo lượt truyền thống. Jordan Neil, COO của công ty chăm sóc khách hàng Fin, mô tả rằng dịch vụ chăm sóc khách hàng bằng giọng nói đã chuyển từ kiểu "hỏi rồi dừng" sang nhịp điệu gần với một cuộc gọi điện thoại bình thường. Còn Cognition thì kết nối mô hình này với Devin, giúp kỹ sư vừa nói vừa cùng tác nhân lập trình bàn bạc giải pháp.
Âm thanh được tạo ra có gắn hình mờ SynthID. Hiện chỉ có một số ít giọng nói để lựa chọn, muốn có giọng tùy chỉnh phải liên hệ bộ phận kinh doanh.
Hiệu quả với tiếng Trung là phần chưa được công bố lần này. OpenAI chỉ cho biết việc hỗ trợ ngôn ngữ và giọng địa phương sẽ được mở rộng dần trong những tháng tới, không đưa ra danh sách ngôn ngữ cụ thể. Các đội đang làm tổng đài chăm sóc khách hàng bằng tiếng Trung nên tự chạy thử nghiệm trước khi quyết định có chuyển sang dùng hay không.
Nguồn tham khảo: Thông báo chính thức và tài liệu dành cho nhà phát triển của OpenAI (xác minh giá, giao diện và giới hạn đồng thời), Unite.AI, CocoLoop, các phát biểu công khai từ khách hàng như Yelp và Speak; các kết quả kiểm định đều theo số liệu do OpenAI công bố.