Qual é a leitura de um manômetro em uma fábrica? Parece simples, mas antes os robôs não conseguiam fazer isso.
Não que o robô não veja o mostrador – ele pode tirar uma foto e reconhecer que é um instrumento circular. Mas uma afirmação como "o ponteiro aponta para 237, a unidade é PSI, a leitura atual é anormal" exige uma combinação de compreensão visual, raciocínio numérico, conhecimento de contexto e saber o que "237 PSI" significa no equipamento atual.
Em 15 de abril, o Google DeepMind lançou o Gemini Robotics-ER 1.6, fornecendo um número concreto para essa capacidade: precisão de leitura de instrumentos de 86%, chegando a 93% com o Agentic Vision ativado. Comparado à versão anterior? 23%.
Isso não é uma pequena iteração – é um salto de "basicamente inutilizável" para "aplicável em cenários industriais".
O que este modelo realmente faz
Gemini Robotics-ER significa Embodied Reasoning, ou "raciocínio incorporado" – permitindo que a IA não apenas veja, mas planeje ações e avalie se uma tarefa foi concluída com base no que vê.
A versão 1.6 melhora principalmente em quatro áreas:
Leitura de Instrumentos (Instrument Reading)
Esta é a nova capacidade central. Quando o robô Spot inspeciona uma fábrica, ele enfrenta instrumentos analógicos como manômetros, termômetros e medidores de nível, cujas leituras precisam ser extraídas com precisão. As IAs visuais anteriores frequentemente erravam entre "este medidor está mais ou menos no meio" e "especificamente 237 PSI".
A abordagem do 1.6 combina raciocínio visual com execução de código: primeiro, tira uma captura de tela; depois, usa código para estimar o intervalo do mostrador e a posição do ponteiro; em seguida, fornece a leitura – com precisão inferior a uma divisão de escala. Esta é uma necessidade descoberta pela DeepMind e pela Boston Dynamics durante o uso real, e então desenvolvida especificamente para ela.
Compreensão de Múltiplas Visões (Multi-View Understanding)
Os robôs geralmente têm várias câmeras. Antes, os modelos tinham dificuldade em processar vários fluxos visuais simultaneamente – "Em qual câmera está este objeto? É o mesmo da outra câmera?" O 1.6 pode processar várias entradas visuais ao mesmo tempo e integrá-las em uma compreensão coerente da cena.
Raciocínio Espacial (Pointing & Spatial Reasoning)
Ao usar o método de "primeiro localizar pontos-chave, depois raciocinar sobre relações espaciais", a precisão em tarefas como contar objetos e encontrar pontos de agarre foi melhorada.
Detecção de Conclusão de Tarefa (Success Detection)
Em ambientes com obstruções ou pouca luz, determinar se "esta tarefa foi concluída" sempre foi um desafio para os robôs. O 1.6 mostra melhorias significativas nesta área, permitindo que o robô decida autonomamente se precisa tentar novamente – sem precisar de uma conexão remota para perguntar a um humano.
Como a Boston Dynamics está usando
O robô Spot da Boston Dynamics tem uma linha de produtos de inspeção industrial madura: ele entra em fábricas para inspecionar, gravar áudio e vídeo e documentar o estado dos equipamentos. Mas antes, o Spot conseguia ver o mostrador, mas não conseguia ler o número com precisão – ou um trabalhador tinha que acompanhá-lo, ou o Spot tirava fotos e as enviava para interpretação manual.
Agora, essa etapa pode ser eliminada.
Marco da Silva, VP da Boston Dynamics, disse: "A leitura de instrumentos e um raciocínio de tarefas mais confiável permitirão que o Spot veja, entenda e responda de forma totalmente autônoma aos desafios do mundo real."
Isso não é um discurso de marketing, mas uma mudança concreta no cenário de uso: antes, uma pessoa tinha que acompanhar o Spot para registrar as leituras de cada equipamento; agora, o Spot pode completar toda a rota de inspeção de forma totalmente autônoma, e a pessoa só precisa ver o relatório final.
Os números falam por si
Comparação direta de desempenho:
| Capacidade | Gemini Robotics-ER 1.5 | Gemini Robotics-ER 1.6 |
|---|---|---|
| Precisão na leitura de instrumentos | 23% | 86% (Agentic Vision: 93%) |
| Percepção de risco de segurança em vídeo | Valor base | +10% |
| Percepção de risco de segurança em texto | Valor base | +6% |
A precisão na leitura de instrumentos saltou de 23% para 86% – essa diferença significa, basicamente, que essa função passou do estágio de protótipo para o estágio de aplicação prática.
O que a abertura da API significa
O Gemini Robotics-ER 1.6 é disponibilizado para desenvolvedores por meio da Gemini API e do Google AI Studio. Essa forma de distribuição é importante.
Fabricantes de hardware (não apenas a Boston Dynamics) agora podem chamar este modelo diretamente, integrando raciocínio visual avançado em suas próprias plataformas robóticas – sem precisar treinar, sem precisar manter pesos de modelo, apenas com uma chamada de API. Isso reduz significativamente a barreira de entrada e permite que a IA robótica da DeepMind penetre mais rapidamente em vários cenários industriais.
Isso difere da lógica da Waymo, que acumula dados de testes de estrada como um fosso: a DeepMind segue o caminho da plataforma, permitindo que parceiros de hardware terceirizados popularizem a capacidade. Qual robô a usar, esse robô ganha uma capacidade adicional diretamente comercializável em inspeção industrial.
Os robôs industriais podem ainda estar a uma certa distância de "entrar em uma fábrica sem que uma única pessoa precise acompanhar", mas o fato de o Spot conseguir ler painéis de instrumentos já é um passo mais perto.
Fontes de referência: Gemini Robotics ER 1.6: Enhanced Embodied Reasoning (Google DeepMind Blog); DeepMind launches Gemini Robotics-ER 1.6 to meet precise physical AI demands (SiliconANGLE); CocoLoop, Google DeepMind Releases Gemini Robotics-ER 1.6 (MarkTechPost)