Le mode vocal de ChatGPT gère désormais les plugins et trois modèles GPT-6

Le 23 septembre, OpenAI a mis à jour le mode vocal de ChatGPT avec trois changements à la fois : la voix peut désormais appeler des plugins comme la messagerie, l'agenda et Slack ; elle peut tourner sur les trois modèles GPT-6, à savoir Astra, Sol et Luna ; et les versions web et mobile de ChatGPT Work ont elles aussi reçu la voix. Le déploiement a commencé le jour même.

Trois changements

Les plugins entrent dans la voix. Auparavant, utiliser un plugin demandait de taper ; il suffit désormais de parler à son téléphone pour que ChatGPT fouille la boîte mail, consulte l'agenda ou retrouve des messages dans Slack. Parmi les applications déjà connectées citées par plusieurs médias figurent Gmail, Google Agenda et Slack.

Le modèle au choix. Les trois modèles GPT-6 se répartissent les rôles : Astra est le plus puissant, Sol se situe entre les deux, Luna est le plus petit. Astra était déjà disponible depuis plusieurs semaines, tandis que Sol et Luna viennent tout juste de passer de GPT-5.6 à GPT-6 le 22 septembre, le mode vocal ayant connecté les trois modèles dès le lendemain.

Arrivée dans ChatGPT Work. Work est l'espace de travail d'OpenAI pour les tâches à plusieurs étapes comme les documents, tableurs, présentations et sites web ; avec la voix intégrée, les utilisateurs peuvent dicter leurs besoins pour générer des fichiers. Vaibhav Srivastav, employé d'OpenAI, l'a décrit ainsi sur un réseau social :

"Your email, calendar, Slack + docs, decks, sites and spreadsheets, just by talking."

En résumé : messagerie, agenda, Slack, mais aussi documents, présentations, sites web et tableurs, juste en parlant.

La comparaison de 9to5Mac est que cela ressemble à Codex sur ordinateur, sauf que cela apparaît à davantage d'endroits.

Quels forfaits auront accès à la voix avec plugins, si les utilisateurs gratuits sont inclus, et si les actions des plugins déclenchées par la voix nécessitent une confirmation au cas par cas, sont des points que les documents publics ne précisent pas.

De la conversation à l'exécution

En reliant les précédentes mises à jour vocales déjà rapportées, on voit que l'accent mis par OpenAI sur la voix se déplace. En juillet, le mode vocal de ChatGPT était passé au modèle vocal GPT-Live, centré sur le full-duplex : écouter et parler en même temps, avec la possibilité d'interrompre en cours de phrase ; les améliorations portaient surtout sur le rythme de la conversation, et ce que les utilisateurs pouvaient lui faire faire n'avait guère changé.

Cette fois, le changement porte sur le modèle de raisonnement sous-jacent et sur les outils que l'on peut appeler. La même porte d'entrée « voix » est passée d'un outil de conversation à une porte d'entrée opérationnelle capable de toucher aux données de l'utilisateur. Cela soulève aussi de nouvelles questions de permissions : une instruction vocale vague qui pousse l'assistant à envoyer un e-mail ou à modifier un rendez-vous coûte bien plus cher en cas d'erreur qu'une réponse erronée à une question.

Ce que cela signifie pour les utilisateurs en Chine

ChatGPT n'est pas officiellement proposé en Chine continentale, et Gmail comme Google Agenda, principaux services connectés par cette mise à jour, n'y sont pas non plus directement accessibles, si bien que l'impact direct pour l'utilisateur ordinaire en Chine continentale est quasi nul.

Les utilisateurs sinophones qui travaillent à l'étranger et utilisent au quotidien la suite Google et Slack peuvent en profiter directement. Pour les équipes en Chine, une piste de réflexion est que l'assistant vocal ne se contente plus de se connecter à des modèles, mais obtient aussi des droits de lecture et d'écriture sur des systèmes de bureau comme la messagerie, l'agenda et la messagerie instantanée. Des fournisseurs chinois s'y emploient également : le modèle vocal de Qwen a déjà commencé à prendre en charge l'appel d'outils, mais les produits où la voix lit et écrit directement des e-mails et des agendas professionnels restent rares.

Dans le contexte bureautique chinois, l'équivalent est la messagerie et l'agenda de WeCom, DingTalk et Feishu ; le fournisseur qui reliera en premier l'entrée vocale aux droits de lecture et d'écriture de ces systèmes, tout en gérant bien le mécanisme de confirmation en cas de mauvaise manipulation, marquera sans doute le prochain tour de la compétition entre assistants vocaux.

Sources : comptes officiels d'OpenAI sur les réseaux sociaux, 9to5Mac, CocoLoop, Android Headlines ; les dates de mise à niveau des trois modèles GPT-6 et l'étendue de l'intégration vocale suivent les annonces officielles d'OpenAI.