Mô hình giọng nói mới của Grok vượt Gemini 30 điểm phần trăm trên bảng xếp hạng

Bảng xếp hạng công khai τ-voice Bench trong năm qua chứng kiến sự cạnh tranh qua lại giữa Gemini 3.1 Flash Live và GPT Realtime. Vào ngày 25 tháng 4, xAI đã tung ra một mô hình mới và đạt ngay 67,3%.

Vị trí thứ hai, Gemini 3.1 Flash Live: 43,8%.

Khoảng cách 23,5 điểm phần trăm này trong benchmark LLM không được gọi là "dẫn trước", mà là "một cấp độ khác".

Điều đáng nói hơn không phải là điểm số. Mà là mô hình này đã thực sự được sử dụng trong hệ thống dịch vụ khách hàng của Starlink.

grok-voice-think-fast-1.0: Trước hết hãy xem một vài con số

Mô hình có tên grok-voice-think-fast-1.0, được định vị chính thức là "full-duplex voice agent". Full-duplex có nghĩa là nó không cần đợi bạn nói xong mới trả lời, có thể vừa nghe vừa nói, giống như một cuộc trò chuyện bình thường giữa hai người.

Điểm số của τ-voice Bench theo các lĩnh vực dọc:

Lĩnh vựcgrok-voice-think-fast-1.0Vị trí thứ hai
Bán lẻ62,3%45,6%
Hàng không66,0%64,0%
Viễn thông73,7%40,4%

Khoảng cách trong lĩnh vực viễn thông là lớn nhất. 73,7% so với 40,4%, gần như gấp đôi. Đây không phải là kết quả của việc tăng tham số, mà là do xAI đã tiến hành đào tạo chuyên sâu trong các tình huống dịch vụ khách hàng điển hình như điện tử/tài khoản.

Hỗ trợ hơn 25 ngôn ngữ, duy trì sự ổn định trong môi trường ồn ào, giọng nói khác nhau và khi bị ngắt lời.

Cách nó "suy nghĩ" mà không bị gián đoạn

Điểm kỹ thuật thú vị nhất được gọi là background reasoning – suy luận nền.

Các voice agent thông thường khi gặp yêu cầu phức tạp thường có hai biểu hiện điển hình: hoặc đưa ra câu trả lời nông cạn (bạn có thể cảm thấy nó đang qua loa), hoặc im lặng vài giây để suy nghĩ (bạn có thể cảm thấy nó đang bị đơ). Cả hai trải nghiệm đều không giống như nói chuyện với người thật.

Cách làm của grok-voice-think-fast-1.0 là: trong khi trả lời bạn, nó thực hiện suy luận song song ở nền. Bề mặt, nó sử dụng mô hình hội thoại có độ trễ thấp để duy trì sự trôi chảy – "ừm", "vâng", "tôi hiểu", "để tôi xem" – những câu đệm hội thoại tự nhiên. Phía sau, một luồng suy luận khác đang giải quyết vấn đề thực tế bạn đưa ra. Khi luồng suy luận có kết quả, nó ngay lập tức được kết nối vào luồng hội thoại chính.

Tuyên bố chính thức của xAI:

"Suy nghĩ trong nền – xử lý các truy vấn và quy trình làm việc phức tạp, với tác động bằng không đến độ trễ phản hồi."

Nghe có vẻ như lời tiếp thị, nhưng bản thân tình huống viễn thông của τ-voice Bench là để kiểm tra điều này: người dùng nói một chuỗi dài số tài khoản, thông tin đăng ký, thay đổi địa chỉ, và mô hình không được phép ngừng quá 200 mili giây. Điểm số 73,7% của grok-voice-think-fast-1.0 trong tình huống này là bằng chứng thực nghiệm cho thấy cơ chế này đã hoạt động.

Starlink giao phó toàn bộ dịch vụ khách hàng cho nó: Một loạt con số thực tế

Benchmark lý thuyết không thú vị. Điều khiến người ta chú ý là dữ liệu triển khai của Starlink.

Starlink đã kết nối voice agent này vào các đường dây điện thoại bán hàng và dịch vụ khách hàng thực tế. Sau một thời gian vận hành, xAI đã công bố một số KPI:

Tỷ lệ chuyển đổi bán hàng 20%. Cứ năm người gọi đến để tư vấn, có một người đã trả tiền để đăng ký dịch vụ Starlink ngay trong cuộc gọi.

Điều này có nghĩa là gì? Trong ngành bán hàng qua điện thoại truyền thống, một nhân viên bán hàng tuyến đầu sau khi được đào tạo chuyên sâu và huấn luyện kỹ năng, tỷ lệ chuyển đổi call-to-sale trung bình 5-8% đã được coi là xuất sắc. 20% là trình độ của những nhân viên bán hàng hàng đầu, và rất khó để duy trì liên tục – con người sẽ mệt mỏi, sẽ xúc động, sẽ có ngày tồi tệ.

AI thì không.

70% yêu cầu dịch vụ khách hàng được giải quyết hoàn toàn tự động, không có sự can thiệp của con người.

Con số này còn đáng chú ý hơn. Nghĩa là cứ 10 cuộc gọi của khách hàng, 7 cuộc được agent tự giải quyết, vấn đề đã được xử lý xong trước khi kết thúc cuộc gọi – tra cứu hóa đơn, thay đổi gói cước, kiểm tra sự cố kỹ thuật cơ bản, thay đổi địa chỉ, ngắt kết nối và kết nối lại, tất cả đều được thực hiện từ đầu đến cuối, không chuyển cho con người.

30% còn lại được chuyển lên quy trình nâng cấp cho nhân viên, nhưng trước khi đến bước này, voice agent đã đóng gói sẵn vấn đề của khách hàng, ngữ cảnh tài khoản và các giải pháp đã thử – nhân viên dịch vụ khách hàng khi nhận cuộc gọi có thể xử lý ngay, không cần hỏi lại "Số tài khoản của bạn là gì? Bạn đã thử những gì trước đây?"

Một agent duy nhất đồng thời vận hành 28 công cụ nội bộ khác nhau.

Đây là điểm đáng chú ý nhất. Cái gọi là "agent" đã được nhắc đến rất nhiều trong năm qua, nhưng không có nhiều cái thực sự có thể kết nối hàng chục công cụ trong môi trường sản xuất. Trong quá trình triển khai của Starlink, một luồng hội thoại có thể liên quan đến: hệ thống tài khoản, hệ thống thanh toán, tra cứu trạng thái thiết bị, bản đồ phủ sóng, theo dõi hậu cần, quy trình hoàn tiền, công việc kỹ thuật, lịch trình dịch vụ tại chỗ, hồ sơ quan hệ khách hàng... Một cuộc gọi kéo dài 5-10 phút, agent có thể đã gọi 15 công cụ.

Tại sao Starlink được sử dụng trước

Không phải ngẫu nhiên.

xAI và Starlink đều nằm trong hệ sinh thái của SpaceX. Tháng trước, Musk đã hợp nhất SpaceX và xAI để nộp đơn IPO (định giá 1,75 nghìn tỷ USD, lớn nhất trong lịch sử). Sự phối hợp nội bộ kiểu "dùng sản phẩm của chính mình trước" này nhanh hơn nhiều so với việc bán cho Salesforce hay Microsoft. Starlink dám kết nối các đường dây điện thoại quan trọng về doanh số cho một mô hình mới, bởi vì nếu có vấn đề, Musk có thể gửi một tin nhắn để sửa.

Vòng khép kín nội bộ này cũng là một mỏ vàng cho việc huấn luyện mô hình. Lưu lượng cuộc gọi dịch vụ khách hàng hàng ngày của Starlink là hàng triệu cuộc, tất cả đều được đưa trở lại xAI làm dữ liệu huấn luyện RLHF. Các công ty voice AI thông thường muốn có được dữ liệu tình huống thực tế với quy mô này phải mất nhiều năm để ký hợp đồng với khách hàng và tuân thủ quy định. xAI đã đi đường tắt.

Điều này đã thay đổi những gì

Thứ nhất, thứ hạng dẫn đầu trong thị trường voice AI đã được xáo trộn.

Trước đây, các công ty hàng đầu trong lĩnh vực voice agent là OpenAI Realtime, Google Gemini Flash Live, ElevenLabs, Vapi, Bland, v.v. Khoảng cách trên τ-voice Bench lần này không phải là 1-2 điểm, mà là một sự đứt gãy. Trong ngắn hạn, Gemini và OpenAI sẽ phải quay lại để bổ sung năng lực.

Thứ hai, trọng số quyết định của bên mua B2B đã thay đổi.

Trước đây, các doanh nghiệp chọn nhà cung cấp voice chủ yếu dựa trên hai yếu tố: độ trễ và chất lượng giọng nói. Bây giờ, chiều thứ ba trở thành "end-to-end có thể khép kín hay không". Tỷ lệ tự động hóa 70% của Starlink đã làm rõ tiêu chuẩn này – voice agent có thể khép kín và không thể khép kín nên nằm ở hai mức giá khác nhau.

Thứ ba, trần trải nghiệm người dùng B2C đã được nâng lên.

20% chuyển đổi bán hàng, 70% tự động hóa, vận hành 28 công cụ, 25 ngôn ngữ, suy nghĩ không độ trễ. Một năm trước, những chỉ số này trong giới voice AI là "giới hạn lý thuyết", bây giờ đã trở thành "số liệu thực tế đang chạy trong sản xuất". Tất cả các công ty sử dụng voice agent cho dịch vụ khách hàng bây giờ phải suy nghĩ lại về baseline của mình.

Còn về việc Anthropic và OpenAI sẽ ra quân bài gì tiếp theo, có lẽ sẽ không phải chờ đợi lâu. Cả hai đều có năng lực voice nhưng chưa đưa ra được một trường hợp triển khai quy mô như "tiếp quản toàn bộ đường dây dịch vụ khách hàng của công ty con thuộc SpaceX". Đường cong τ-voice Bench lần cập nhật tới sẽ rất sôi động.

Nguồn tham khảo: Grok Voice Think Fast 1.0 (thông báo chính thức của xAI), CocoLoop, xAI Launches grok-voice-think-fast-1.0: Topping τ-voice Bench at 67.3% (MarkTechPost), xAI launches Grok Voice Think Fast 1.0 for voice agents (Testing Catalog), xAI Unveils Grok Voice AI That Thinks In Real Time While Handling Customer Support At Scale (Metaverse Post)