¿Cuál es la lectura de un manómetro en una fábrica? Suena simple, pero antes los robots no podían hacerlo.
No es que el robot no vea la esfera – puede tomar una foto y reconocer que es un instrumento circular. Pero una afirmación como "la aguja apunta a 237, la unidad es PSI, la lectura actual es anormal" requiere una combinación de comprensión visual, razonamiento numérico, conocimiento contextual y saber qué significa "237 PSI" en el equipo actual.
El 15 de abril, Google DeepMind lanzó Gemini Robotics-ER 1.6, proporcionando una cifra concreta para esta capacidad: precisión de lectura de instrumentos del 86 %, alcanzando el 93 % con Agentic Vision activado. ¿En comparación con la versión anterior? 23 %.
Esto no es una iteración menor – es un salto de "básicamente inutilizable" a "aplicable en entornos industriales".
Qué hace realmente este modelo
Gemini Robotics-ER significa Embodied Reasoning, o "razonamiento incorporado" – permite que la IA no solo vea, sino que planifique acciones y evalúe si una tarea se ha completado basándose en lo que ve.
La versión 1.6 mejora principalmente en cuatro áreas:
Lectura de instrumentos (Instrument Reading)
Esta es la nueva capacidad central. Cuando el robot Spot inspecciona una fábrica, se enfrenta a instrumentos analógicos como manómetros, termómetros y medidores de nivel, cuyas lecturas deben extraerse con precisión. Las IAs visuales anteriores a menudo se equivocaban entre "este medidor está más o menos en el medio" y "específicamente 237 PSI".
El enfoque de 1.6 combina el razonamiento visual con la ejecución de código: primero, toma una captura de pantalla; luego, usa código para estimar el rango de la esfera y la posición de la aguja; a continuación, proporciona la lectura – con una precisión inferior a una división de escala. Esta es una necesidad descubierta por DeepMind y Boston Dynamics durante el uso real, y luego desarrollada específicamente para ella.
Comprensión multivista (Multi-View Understanding)
Los robots suelen tener varias cámaras. Antes, los modelos tenían dificultades para procesar múltiples flujos visuales simultáneamente – "¿En qué cámara está este objeto? ¿Es el mismo que en la otra cámara?" El 1.6 puede procesar múltiples entradas visuales al mismo tiempo e integrarlas en una comprensión coherente de la escena.
Razonamiento espacial (Pointing & Spatial Reasoning)
Al utilizar el método de "primero localizar puntos clave, luego razonar sobre relaciones espaciales", se mejoró la precisión en tareas como contar objetos y encontrar puntos de agarre.
Detección de finalización de tareas (Success Detection)
En entornos con obstrucciones o poca luz, determinar si "esta tarea se ha completado" siempre ha sido un desafío para los robots. El 1.6 muestra mejoras significativas en esta área, permitiendo que el robot decida autónomamente si necesita reintentarlo – sin necesidad de una conexión remota para preguntar a un humano.
Cómo lo está usando Boston Dynamics
El robot Spot de Boston Dynamics tiene una línea de productos de inspección industrial madura: entra en fábricas para inspeccionar, grabar audio y video y documentar el estado de los equipos. Pero antes, Spot podía ver la esfera, pero no podía leer el número con precisión – o un trabajador tenía que acompañarlo, o Spot tomaba fotos y las enviaba para interpretación manual.
Ahora, este paso puede eliminarse.
Marco da Silva, vicepresidente de Boston Dynamics, dijo: "La lectura de instrumentos y un razonamiento de tareas más confiable permitirán a Spot ver, entender y responder de forma totalmente autónoma a los desafíos del mundo real."
Esto no es un discurso de marketing, sino un cambio concreto en el escenario de uso: antes, una persona tenía que acompañar a Spot para registrar las lecturas de cada equipo; ahora, Spot puede completar toda la ruta de inspección de forma totalmente autónoma, y la persona solo necesita ver el informe final.
Los números hablan por sí solos
Comparación directa de rendimiento:
| Capacidad | Gemini Robotics-ER 1.5 | Gemini Robotics-ER 1.6 |
|---|---|---|
| Precisión en la lectura de instrumentos | 23 % | 86 % (Agentic Vision: 93 %) |
| Percepción de riesgo de seguridad en video | Valor base | +10 % |
| Percepción de riesgo de seguridad en texto | Valor base | +6 % |
La precisión en la lectura de instrumentos saltó del 23 % al 86 % – esta diferencia significa, básicamente, que esta función ha pasado de la etapa de prototipo a la etapa de aplicación práctica.
Qué significa la apertura de la API
Gemini Robotics-ER 1.6 se pone a disposición de los desarrolladores a través de la API de Gemini y Google AI Studio. Esta forma de distribución es importante.
Los fabricantes de hardware (no solo Boston Dynamics) ahora pueden llamar a este modelo directamente, integrando razonamiento visual avanzado en sus propias plataformas robóticas – sin necesidad de entrenar, sin necesidad de mantener pesos de modelo, solo con una llamada a la API. Esto reduce significativamente la barrera de entrada y permite que la IA robótica de DeepMind penetre más rápidamente en varios escenarios industriales.
Esto difiere de la lógica de Waymo, que acumula datos de pruebas de carretera como un foso: DeepMind sigue el camino de la plataforma, permitiendo que socios de hardware externos popularicen la capacidad. Cualquier robot que la use, ese robot gana una capacidad adicional directamente comercializable en inspección industrial.
Los robots industriales pueden estar todavía a cierta distancia de "entrar en una fábrica sin que una sola persona tenga que acompañarlos", pero el hecho de que Spot pueda leer paneles de instrumentos ya es un paso más cerca.
Fuentes de referencia: Gemini Robotics ER 1.6: Enhanced Embodied Reasoning (Google DeepMind Blog); DeepMind launches Gemini Robotics-ER 1.6 to meet precise physical AI demands (SiliconANGLE); CocoLoop, Google DeepMind Releases Gemini Robotics-ER 1.6 (MarkTechPost)