DeepMind, 로봇이 공장 계기판을 읽고 산업 점검을 수행하도록 가르치다

공장의 압력계 수치를 읽는 것은 간단해 보이지만, 지금까지 로봇은 할 수 없었다.

로봇이 다이얼을 볼 수 없는 것은 아니다. 사진을 찍고 원형 계기판임을 인식할 수 있다. 하지만 "바늘이 237을 가리키고, 단위는 PSI이며, 현재 수치가 이상하다"는 판단을 내리려면 시각적 이해, 수치 추론, 상황 지식, 그리고 "237 PSI"가 해당 장비에서 무엇을 의미하는지에 대한 이해가 결합되어야 한다.

Google DeepMind는 4월 15일 Gemini Robotics-ER 1.6을 발표하며 이 능력에 대한 구체적인 수치를 제시했다. 계기판 판독 정확도는 86%, Agentic Vision을 활성화하면 93%에 달한다. 이전 버전과 비교하면? 23%였다.

이는 소규모 개선이 아니다. "기본적으로 사용할 수 없는" 상태에서 "산업 현장에 투입할 수 있는" 상태로의 도약이다.

이 모델이 실제로 하는 일

Gemini Robotics-ER는 Embodied Reasoning(구체화된 추론)의 약자로, AI가 단순히 보는 것에 그치지 않고 본 것을 바탕으로 동작을 계획하고 작업 완료 여부를 판단할 수 있도록 한다.

버전 1.6은 주로 네 가지 영역을 업그레이드했다.

계기판 판독(Instrument Reading)

가장 핵심적인 새로운 기능이다. Spot 로봇이 공장을 점검할 때 압력계, 온도계, 액위계와 같은 아날로그 계기판을 마주하며, 이 수치를 정확하게 추출해야 한다. 기존의 시각 AI는 "계기판이 대략 중간쯤"과 "정확히 237 PSI" 사이에서 오류를 범하는 경우가 많았다.

버전 1.6은 시각적 추론과 코드 실행을 결합한다. 이미지를 캡처한 다음 코드를 사용하여 다이얼 범위와 바늘 위치를 추정하고 수치를 출력한다. 정확도는 눈금 한 칸 미만이다. 이는 DeepMind와 Boston Dynamics가 실제 사용 과정에서 발견한 필요에 따라 특별히 개발된 기능이다.

다중 시점 이해(Multi-View Understanding)

로봇에는 일반적으로 여러 대의 카메라가 장착되어 있다. 이전 모델은 여러 영상 입력을 처리할 때 "이 물체가 어느 카메라에 있지? 다른 카메라에 있는 것과 같은 물체인가?"와 같이 혼란을 겪는 경우가 많았다. 버전 1.6은 여러 시각적 입력을 동시에 처리하여 이를 하나의 일관된 장면 이해로 통합할 수 있다.

공간 추론(Pointing & Spatial Reasoning)

먼저 주요 지점을 찾은 다음 공간 관계를 추론하는 방식을 통해 물체 세기, 파지점 찾기와 같은 작업의 정확도를 향상시켰다.

작업 완료 판단(Success Detection)

가려짐이 있거나 조명이 나쁜 환경에서 작업이 완료되었는지 판단하는 것은 로봇에게 항상 어려운 과제였다. 버전 1.6은 이 부분에서 눈에 띄게 개선되어 로봇이 원격으로 사람에게 문의할 필요 없이 재시도 여부를 자율적으로 결정할 수 있게 되었다.

Boston Dynamics의 활용 방식

Boston Dynamics의 Spot 로봇은 공장 순찰, 오디오/비디오 녹화, 장비 상태 기록 등 성숙된 산업 점검 제품 라인을 보유하고 있다. 그러나 이전까지 Spot은 다이얼을 볼 수는 있었지만 숫자를 정확히 읽을 수는 없었다. 작업자가 따라다니거나, Spot이 사진을 찍어 보내면 사람이 수동으로 판독해야 했다.

이제 이 단계를 생략할 수 있다.

Boston Dynamics의 부사장 Marco da Silva는 "계기판 판독과 더욱 신뢰할 수 있는 작업 추론을 통해 Spot이 현실 세계의 과제를 완전히 자율적으로 보고, 이해하고, 대응할 수 있게 될 것"이라고 말했다.

이는 마케팅 수사가 아니다. 구체적인 사용 사례의 변화다. 이전에는 사람이 Spot을 따라다니며 각 장비의 수치를 기록해야 했지만, 이제 Spot이 점검 경로 전체를 자율적으로 완료하고 사람은 최종 보고서만 확인하면 된다.

숫자가 말해주는 것

직접적인 성능 비교:

능력Gemini Robotics-ER 1.5Gemini Robotics-ER 1.6
계기판 판독 정확도23%86%(Agentic Vision: 93%)
비디오 안전 위험 인식기준치+10%
텍스트 안전 위험 인식기준치+6%

계기판 판독이 23%에서 86%로 향상된 것은 이 기능이 프로토타입 단계에서 실용 단계로 진입했음을 의미한다.

API 공개의 의미

Gemini Robotics-ER 1.6은 Gemini API와 Google AI Studio를 통해 개발자에게 제공된다. 이 배포 방식은 중요하다.

하드웨어 제조사(Boston Dynamics뿐만 아니라)는 이제 이 모델을 직접 호출하여 고급 시각 추론을 자체 로봇 플랫폼에 통합할 수 있다. 자체 모델을 훈련시키거나 모델 가중치를 유지할 필요 없이 API 호출만으로 가능하다. 이는 진입 장벽을 크게 낮추고 DeepMind의 로봇 AI가 다양한 산업 현장에 더 빠르게 침투할 수 있게 한다.

이는 Waymo가 주행 데이터를 진입 장벽으로 축적하는 논리와는 다르다. DeepMind는 플랫폼 전략을 채택하여 서드파티 하드웨어 파트너가 역량을 보급하도록 한다. 이 모델을 사용하는 로봇은 산업 점검에서 직접 상용화할 수 있는 능력을 하나 더 얻게 된다.

산업용 로봇이 "공장에 한 명의 사람도 따라다닐 필요가 없는" 상태에 도달하려면 아직 시간이 더 필요할 수 있다. 하지만 Spot이 계기판을 읽을 수 있게 된 것은 그 지점에 한 걸음 더 가까워졌음을 의미한다.

출처: Gemini Robotics ER 1.6: Enhanced Embodied Reasoning(Google DeepMind Blog); DeepMind launches Gemini Robotics-ER 1.6 to meet precise physical AI demands(SiliconANGLE); CocoLoop, Google DeepMind Releases Gemini Robotics-ER 1.6(MarkTechPost)