Grokの新音声モデル、ベンチマークでGeminiを30ポイント上回る

公開ベンチマーク「τ-voice Bench」では、この1年、Gemini 3.1 Flash LiveとGPT Realtimeが首位を争ってきた。4月25日、xAIが新モデルを投入し、67.3%を獲得した。

2位のGemini 3.1 Flash Liveは43.8%である。

この23.5ポイントの差は、LLMベンチマークでは「リード」ではなく、「別次元」と呼ぶべきものだ。

注目すべきはスコアだけではない。このモデルはStarlinkのカスタマーサービスシステムで実際に稼働していることだ。

grok-voice-think-fast-1.0:まずは数字から

モデル名はgrok-voice-think-fast-1.0。公式の位置づけは「full-duplex音声エージェント」である。Full-duplexとは、相手が話し終えるのを待たずに応答できることを意味し、人間同士の自然な会話のように、聞きながら話すことができる。

τ-voice Benchの分野別スコア:

分野 grok-voice-think-fast-1.0 2位
小売 62.3% 45.6%
航空 66.0% 64.0%
通信 73.7% 40.4%

通信分野での差が最も顕著だ。73.7%対40.4%と、ほぼ倍である。これはパラメータを積み上げた結果ではなく、xAIがカスタマーサービス、特に電子機器やアカウント管理といった典型的なシナリオに特化して大規模なトレーニングを実施した成果である。

25以上の言語に対応し、騒がしい環境、アクセント、話の途中での割り込みに対しても安定した性能を発揮する。

「考える」動作が途切れない仕組み

最も興味深い技術的特徴はbackground reasoning(バックグラウンド推論)である。

一般的な音声エージェントは、複雑なリクエストに対して、浅い回答をする(ごまかしていると感じる)か、数秒間沈黙して考える(処理中だと感じる)かのどちらかの行動を示す。どちらの体験も、人間との会話には程遠い。

grok-voice-think-fast-1.0のアプローチは、応答と並行してバックグラウンドで推論を実行することである。表面上は、低遅延の対話モデルが流暢さを維持する。「うん」「そうですね」「わかりました」「確認します」といった自然な会話のつなぎ言葉を使う。その背後で、別の推論パスがユーザーの実際の問題を解決する。推論パスの結果が出ると、すぐにメインの対話ストリームに統合される。

xAIの公式発表:

「バックグラウンドで思考する——応答遅延にゼロの影響で、複雑なクエリとワークフローを処理する」

マーケティング用語のように聞こえるが、τ-voice Benchの通信シナリオはまさにこれをテストするために設計されている。ユーザーが長いアカウント番号、契約情報、住所変更を一気に話し、モデルは200ミリ秒以上停止してはならない。このシナリオでgrok-voice-think-fast-1.0が73.7%のスコアを達成したことは、このメカニズムが機能していることの実証である。

Starlinkがカスタマーサービスをすべて任せた:具体的な成果

理論上のベンチマークは面白くない。注目すべきはStarlinkの導入データである。

Starlinkはこの音声エージェントを実際の販売およびカスタマーサービスの電話回線に接続した。一定期間の運用後、xAIはいくつかのKPIを公開した。

販売転換率20%。問い合わせで電話をかけてきた5人のうち、1人が通話中に直接Starlinkサービスに申し込んだことになる。

従来のテレマーケティング業界では、専門的なトレーニングとトークスクリプトを経た現場のセールス担当者でも、平均的なコール・トゥ・セールス転換率は5~8%が優秀とされる。20%は人間のセールスでもトップクラスの成績であり、それを継続的に維持するのは非常に難しい。人間は疲れたり、感情的になったり、調子の悪い日があるからだ。

AIにはそれがない。

カスタマーサービスリクエストの70%が、人間の介入なしに完全に自律解決されている。

このデータはさらに衝撃的である。顧客からの電話10件のうち、7件はエージェントが単独で処理し、電話を切る前に問題を解決していることを意味する。請求照会、プラン変更、技術的なトラブルの初動対応、住所変更、サービス停止・再開——すべてエンドツーエンドで完了し、人間に転送されることはない

残りの30%はエスカレーションされ人間のオペレーターが対応するが、その段階に至るまでに、音声エージェントは顧客の問題、アカウントのコンテキスト、試行済みの解決策をパッケージ化している。人間のオペレーターは「お客様番号は? これまでにどのようなことを試されましたか?」と尋ねることなく、直接対応を開始できる。

単一のエージェントが28種類の異なる内部ツールを同時に操作する。

これが最も注目すべき点である。「エージェント」という言葉はこの1年で使い古されたが、本番環境で数十のツール呼び出しを実際に連携させられるものは多くない。今回のStarlinkの導入では、1つの会話フローで、アカウントシステム、課金システム、デバイスステータス照会、カバレッジマップ、物流追跡、返金処理、技術チケット、訪問サービススケジュール、顧客関係記録などが関与する可能性がある。5~10分の通話で、エージェントは15回のツール呼び出しを行うこともある。

なぜStarlinkが最初に採用したのか

偶然ではない。

xAIとStarlinkはどちらもSpaceXのエコシステム内にある。先月、MuskはSpaceXとxAIを統合し、IPOを申請した(評価額1.75兆ドル、史上最大)。この「自社製品をまず自社で使う」という内部連携は、SalesforceやMicrosoftに販売するよりもはるかに速い。Starlinkが売上に直結する重要な電話回線を新モデルに接続できたのは、問題が発生した場合、Muskがテキストメッセージ一つで修正できるからである。

この内部ループはモデルトレーニングにとっても金鉱である。Starlinkの1日あたりのカスタマーサービス通話量は数百万件に上り、すべてRLHFのトレーニングデータとしてxAIに還元される。一般的な音声AI企業がこの規模の実世界データを入手するには、顧客獲得とコンプライアンス対応に何年もかかる。xAIは近道を選んだのだ。

この出来事が変えるもの

第一に、音声AI市場の勢力図が塗り替えられた。

これまで音声エージェント分野のトップは、OpenAI Realtime、Google Gemini Flash Live、ElevenLabs、Vapi、Blandなどであった。今回のτ-voice Benchでの差は1~2ポイントではなく、断絶である。短期的には、GeminiとOpenAIは能力の補強に戻らざるを得ないだろう。

第二に、B2B購入者の意思決定基準が変わった。

これまで企業が音声ベンダーを選ぶ際の主な基準は、遅延と音質の2点であった。今、第三の軸として「エンドツーエンドで課題を完結できるか」が加わった。Starlinkの70%自律解決率はこの基準を明確にした。完結できる音声エージェントとできないものは、異なる価格帯に位置づけられるべきである。

第三に、B2Cユーザーエクスペリエンスの天井が引き上げられた。

20%の販売転換率、70%の自律解決、28ツールの操作、25言語対応、ゼロ遅延思考。1年前、これらの指標は音声AI業界では「理論上の限界」と見なされていた。今や「本番環境で稼働中の実測値」である。カスタマーサービスに音声エージェントを利用するすべての企業は、自社のベースラインを再考する必要がある。

AnthropicとOpenAIが次にどのような手を打つのか、おそらく長く待つ必要はないだろう。両社とも音声機能は持っているが、SpaceX傘下の企業のカスタマーサービス回線すべてを引き継ぐという規模の導入事例はまだ示していない。τ-voice Benchの曲線は、次回の更新で非常に興味深いものになるだろう。

参考元:Grok Voice Think Fast 1.0(xAI公式発表)、CocoLoop、xAI Launches grok-voice-think-fast-1.0: Topping τ-voice Bench at 67.3%(MarkTechPost)、xAI launches Grok Voice Think Fast 1.0 for voice agents(Testing Catalog)、xAI Unveils Grok Voice AI That Thinks In Real Time While Handling Customer Support At Scale(Metaverse Post)