DeepMind apprend aux robots à lire les tableaux de bord pour l'inspection industrielle

Quelle est la lecture d'un manomètre dans une usine ? Cela semble simple, mais avant, les robots ne pouvaient pas le faire.

Ce n'est pas que le robot ne voie pas le cadran – il peut prendre une photo et reconnaître qu'il s'agit d'un instrument circulaire. Mais une affirmation comme "l'aiguille pointe vers 237, l'unité est le PSI, la lecture actuelle est anormale" nécessite une combinaison de compréhension visuelle, de raisonnement numérique, de connaissances contextuelles et de savoir ce que "237 PSI" signifie sur l'équipement actuel.

Le 15 avril, Google DeepMind a publié Gemini Robotics-ER 1.6, fournissant un chiffre concret pour cette capacité : précision de lecture des instruments de 86 %, atteignant 93 % avec Agentic Vision activé. Par rapport à la version précédente ? 23 %.

Ce n'est pas une petite itération – c'est un bond de "fondamentalement inutilisable" à "applicable dans des environnements industriels".

Ce que fait réellement ce modèle

Gemini Robotics-ER signifie Embodied Reasoning, ou "raisonnement incarné" – il permet à l'IA non seulement de voir, mais aussi de planifier des actions et d'évaluer si une tâche est terminée sur la base de ce qu'elle voit.

La version 1.6 améliore principalement quatre domaines :

Lecture d'instruments (Instrument Reading)

C'est la nouvelle capacité centrale. Lorsque le robot Spot inspecte une usine, il est confronté à des instruments analogiques tels que des manomètres, des thermomètres et des indicateurs de niveau, dont les lectures doivent être extraites avec précision. Les IA visuelles précédentes avaient souvent du mal à faire la différence entre "cet instrument est à peu près au milieu" et "spécifiquement 237 PSI".

L'approche de 1.6 combine le raisonnement visuel avec l'exécution de code : d'abord, il prend une capture d'écran ; ensuite, il utilise du code pour estimer la plage du cadran et la position de l'aiguille ; puis, il fournit la lecture – avec une précision inférieure à une division d'échelle. Il s'agit d'un besoin découvert par DeepMind et Boston Dynamics lors d'une utilisation réelle, puis développé spécifiquement pour cela.

Compréhension multi-vues (Multi-View Understanding)

Les robots ont souvent plusieurs caméras. Avant, les modèles avaient du mal à traiter plusieurs flux visuels simultanément – "Dans quelle caméra se trouve cet objet ? Est-ce le même que dans l'autre caméra ?" Le 1.6 peut traiter plusieurs entrées visuelles en même temps et les intégrer en une compréhension cohérente de la scène.

Raisonnement spatial (Pointing & Spatial Reasoning)

En utilisant la méthode "d'abord localiser les points clés, puis raisonner sur les relations spatiales", la précision des tâches telles que compter des objets ou trouver des points de préhension a été améliorée.

Détection d'achèvement de tâche (Success Detection)

Dans des environnements obstrués ou mal éclairés, déterminer si "cette tâche est terminée" a toujours été un défi pour les robots. Le 1.6 montre des améliorations significatives dans ce domaine, permettant au robot de décider de manière autonome s'il doit réessayer – sans avoir besoin d'une connexion à distance pour demander à un humain.

Comment Boston Dynamics l'utilise

Le robot Spot de Boston Dynamics dispose d'une gamme de produits d'inspection industrielle mature : il entre dans les usines pour inspecter, enregistrer l'audio et la vidéo et documenter l'état des équipements. Mais avant, Spot pouvait voir le cadran, mais ne pouvait pas lire le nombre avec précision – soit un ouvrier devait l'accompagner, soit Spot prenait des photos et les envoyait pour une interprétation manuelle.

Désormais, cette étape peut être supprimée.

Marco da Silva, vice-président de Boston Dynamics, a déclaré : "La lecture des instruments et un raisonnement plus fiable sur les tâches permettront à Spot de voir, comprendre et répondre de manière totalement autonome aux défis du monde réel."

Ce n'est pas un discours marketing, mais un changement concret dans le scénario d'utilisation : avant, une personne devait accompagner Spot pour enregistrer les lectures de chaque équipement ; maintenant, Spot peut effectuer l'intégralité de la route d'inspection de manière totalement autonome, et la personne n'a besoin que de consulter le rapport final.

Les chiffres parlent d'eux-mêmes

Comparaison directe des performances :

Capacité Gemini Robotics-ER 1.5 Gemini Robotics-ER 1.6
Précision de la lecture des instruments 23 % 86 % (Agentic Vision : 93 %)
Perception des risques de sécurité vidéo Valeur de base +10 %
Perception des risques de sécurité textuelle Valeur de base +6 %

La précision de la lecture des instruments est passée de 23 % à 86 % – cet écart signifie, fondamentalement, que cette fonction est passée du stade de prototype au stade d'application pratique.

Ce que signifie l'ouverture de l'API

Gemini Robotics-ER 1.6 est mis à la disposition des développeurs via l'API Gemini et Google AI Studio. Cette forme de distribution est importante.

Les fabricants de matériel (pas seulement Boston Dynamics) peuvent désormais appeler ce modèle directement, intégrant un raisonnement visuel avancé dans leurs propres plateformes robotiques – sans avoir à entraîner, sans avoir à maintenir les poids du modèle, simplement par un appel API. Cela abaisse considérablement la barrière à l'entrée et permet à l'IA robotique de DeepMind de pénétrer plus rapidement dans divers scénarios industriels.

Cela diffère de la logique de Waymo, qui accumule les données d'essais routiers comme un fossé défensif : DeepMind suit la voie de la plateforme, permettant à des partenaires matériels tiers de populariser la capacité. Quel que soit le robot qui l'utilise, ce robot gagne une capacité supplémentaire directement commercialisable dans l'inspection industrielle.

Les robots industriels sont peut-être encore à une certaine distance de "pénétrer dans une usine sans qu'une seule personne doive les accompagner", mais le fait que Spot puisse lire les tableaux de bord est déjà un pas de plus.

Sources de référence : Gemini Robotics ER 1.6: Enhanced Embodied Reasoning (Google DeepMind Blog) ; DeepMind launches Gemini Robotics-ER 1.6 to meet precise physical AI demands (SiliconANGLE) ; CocoLoop, Google DeepMind Releases Gemini Robotics-ER 1.6 (MarkTechPost)