OpenAIは9月23日、ChatGPTの音声モードを一度に3か所アップデートした。音声からプラグインを呼び出せるようになり、対象にはメール、カレンダー、Slackが含まれる。音声はGPT-6の3モデル、Astra、Sol、Lunaの上で動くようになった。そしてChatGPT Workのウェブ版とモバイル版にも音声機能が加わった。配信は当日から始まっている。
3つの変更点
プラグインが音声に対応。 これまでプラグインを使うには文字入力が必要だったが、今はスマートフォンに向かって話しかけるだけで、ChatGPTがメールを確認したり、予定を調べたり、Slackでメッセージを探したりできるようになった。複数のメディアが挙げる接続先アプリにはGmail、Googleカレンダー、Slackが含まれる。
モデルを選べる。 GPT-6の3モデルは役割が異なる。Astraが最も高性能な上位モデル、Solが中間、Lunaが最も軽量だ。Astraは数週間前にすでに公開されており、SolとLunaは9月22日にGPT-5.6からGPT-6へアップグレードされたばかり。音声モードは翌日には3モデルすべてに対応した。
ChatGPT Workにも音声が到達。 Workは文書、表計算、プレゼンテーション、ウェブサイトといった複数手順の作業をこなすOpenAIのワークスペースだ。音声対応により、口頭で要望を伝えるだけでファイルを生成できるようになった。OpenAIのVaibhav Srivastav氏はSNSでこう表現している。
"Your email, calendar, Slack + docs, decks, sites and spreadsheets, just by talking."
訳すと「メール、カレンダー、Slack、それに文書、プレゼン資料、ウェブサイト、表計算まで、話すだけでできる」という意味だ。9to5Macはこれをデスクトップ版Codexに近いものとしつつ、登場する場面がより多いと例えている。
どのプランでプラグイン対応の音声が使えるのか、無料ユーザーが対象に含まれるのか、音声でプラグインを呼び出す際に一つずつ確認が必要かどうかは、公開資料には明記されていない。
会話から作業へ
これまで報じられてきた音声関連の更新を並べると、OpenAIの重心の移動が見えてくる。7月の更新では、ChatGPTの音声はGPT-Live音声モデルに切り替わり、全二重通信を売りに、聞きながら話す、途中で割り込めるといった対話のテンポの改善に集中していた。ユーザーにできることの範囲自体はほとんど変わらなかった。
今回変わったのは背後の推論モデルと呼び出せるツールだ。同じ「音声」という入口が、雑談のためのツールから、ユーザーのデータを動かせる操作の入口へと変わった。これは新しい権限の問題も連れてくる。曖昧な口頭指示でアシスタントにメールを送らせたり予定を変更させたりすると、間違えたときの代償は質問に間違って答えるよりもずっと大きい。
中国本土のユーザーへの影響
ChatGPTは中国本土で正式にはサービス提供されておらず、今回の更新が重点的に接続したGmailとGoogleカレンダーも本土から直接はアクセスできない。そのため、中国本土の一般ユーザーへの直接的な影響はほとんどない。
海外で働き、日常的にGoogle系サービスやSlackを使う中国語話者は、そのまま利用できる。中国本土のチームにとって参考になるのは、音声アシスタントがつながる先がモデルだけでなく、メール、カレンダー、社内チャットといった業務システムの読み書き権限にまで広がっている点だ。中国のベンダーも同様の方向に動いており、AlibabaのQwen音声モデルはすでにツール呼び出しに対応しているが、音声で業務用のメールや予定表を直接読み書きできる製品はまだ多くない。
中国本土の業務環境で対応するのは、WeCom(企業微信)、DingTalk(釘釘)、Feishu(飛書)のメールやスケジュール機能だ。音声の入口とこれらのシステムの読み書き権限を先につなぎ、誤操作時の確認の仏みをきちんと整えたベンダーが、次の音声アシスタント競争の見どころになりそうだ。
参考資料:OpenAI公式SNSアカウント、9to5Mac、CocoLoop、Android Headlines。GPT-6の3モデルのアップグレード時期と音声のプラグイン対応範囲は、OpenAIの公開情報に基づく。