Trong một nhà máy, chỉ số của một đồng hồ đo áp suất là bao nhiêu? Nghe có vẻ đơn giản, nhưng trước đây robot không thể làm được.
Không phải robot không nhìn thấy mặt đồng hồ – nó có thể chụp ảnh, nhận ra đó là một thiết bị đo hình tròn. Nhưng việc đưa ra nhận định "kim đồng hồ chỉ 237, đơn vị là PSI, chỉ số hiện tại bất thường" đòi hỏi sự kết hợp giữa hiểu biết thị giác, suy luận số liệu, kiến thức ngữ cảnh, và phải biết "237 PSI" có ý nghĩa gì trên thiết bị hiện tại.
Vào ngày 15 tháng 4, Google DeepMind đã phát hành Gemini Robotics-ER 1.6, đưa ra một con số cụ thể cho khả năng này: độ chính xác đọc đồng hồ đo đạt 86%, và khi kích hoạt Agentic Vision, con số này lên tới 93%. So với phiên bản trước? 23%.
Đây không phải là một cải tiến nhỏ – đó là bước nhảy từ "về cơ bản không thể sử dụng" lên "có thể ứng dụng trong môi trường công nghiệp".
Mô hình này thực sự làm gì?
Gemini Robotics-ER là viết tắt của Embodied Reasoning, nghĩa là "suy luận nhập thể" – cho phép AI không chỉ nhìn, mà còn lập kế hoạch hành động và đánh giá xem nhiệm vụ đã hoàn thành hay chưa dựa trên những gì nó thấy.
Phiên bản 1.6 nâng cấp chủ yếu ở bốn hướng:
Đọc đồng hồ đo (Instrument Reading)
Đây là khả năng mới cốt lõi. Khi robot Spot kiểm tra nhà máy, nó phải đối mặt với các đồng hồ đo áp suất, nhiệt kế, đồng hồ đo mức chất lỏng – những thiết bị đo tương tự cần trích xuất chính xác chỉ số. Các AI thị giác trước đây dễ mắc lỗi giữa "cái đồng hồ này ở khoảng giữa" và "chính xác là 237 PSI".
Cách tiếp cận của 1.6 là kết hợp suy luận thị giác với thực thi mã: đầu tiên chụp ảnh màn hình, sau đó dùng mã để ước tính phạm vi mặt đồng hồ và vị trí kim, rồi đưa ra chỉ số – với độ chính xác dưới một vạch chia. Đây là nhu cầu được DeepMind và Boston Dynamics phát hiện trong quá trình sử dụng thực tế, và sau đó được phát triển riêng cho nó.
Hiểu đa góc nhìn (Multi-View Understanding)
Robot thường có nhiều camera. Trước đây, các mô hình xử lý nhiều luồng hình ảnh dễ bị nhầm lẫn – "vật thể này nằm trong camera nào? Nó có giống với vật thể trong camera kia không?" 1.6 có thể xử lý đồng thời nhiều luồng thị giác và tích hợp chúng thành một hiểu biết ngữ cảnh thống nhất.
Suy luận không gian (Pointing & Spatial Reasoning)
Bằng cách "xác định điểm chính trước, sau đó suy luận mối quan hệ không gian", độ chính xác của các tác vụ như đếm vật thể, tìm điểm cầm nắm được cải thiện.
Phát hiện hoàn thành nhiệm vụ (Success Detection)
Trong môi trường bị che khuất hoặc ánh sáng kém, việc xác định "nhiệm vụ này đã hoàn thành chưa" luôn là một thách thức đối với robot. 1.6 có cải thiện đáng kể trong lĩnh vực này, cho phép robot tự quyết định có cần thử lại hay không – mà không cần kết nối từ xa để hỏi con người.
Boston Dynamics đang sử dụng nó như thế nào?
Robot Spot của Boston Dynamics có một dòng sản phẩm kiểm tra công nghiệp hoàn chỉnh: đi vào nhà máy kiểm tra, ghi âm, quay video, ghi lại trạng thái thiết bị. Nhưng trước đây, Spot có thể nhìn thấy mặt đồng hồ nhưng không thể đọc chính xác chỉ số – hoặc là công nhân phải đi theo để xem, hoặc Spot chụp ảnh và gửi về để con người đọc thủ công.
Bây giờ, bước này có thể được loại bỏ.
Phó Chủ tịch Boston Dynamics, Marco da Silva, cho biết: "Khả năng đọc đồng hồ đo và suy luận nhiệm vụ đáng tin cậy hơn sẽ cho phép Spot hoàn toàn tự động nhìn, hiểu và phản ứng với những thách thức trong thế giới thực."
Đây không phải là lời tiếp thị, mà là một sự thay đổi cụ thể trong kịch bản sử dụng: trước đây, con người phải đi theo Spot để ghi lại chỉ số của từng thiết bị; bây giờ, Spot có thể hoàn toàn tự động thực hiện toàn bộ tuyến kiểm tra, con người chỉ cần xem báo cáo cuối cùng.
Con số nói lên vấn đề
So sánh hiệu suất trực tiếp:
| Khả năng | Gemini Robotics-ER 1.5 | Gemini Robotics-ER 1.6 |
|---|---|---|
| Độ chính xác đọc đồng hồ đo | 23% | 86% (Agentic Vision: 93%) |
| Nhận biết rủi ro an toàn video | Giá trị cơ sở | +10% |
| Nhận biết rủi ro an toàn văn bản | Giá trị cơ sở | +6% |
Độ chính xác đọc đồng hồ đo từ 23% lên 86% – khoảng cách này về cơ bản có nghĩa là chức năng này đã chuyển từ giai đoạn nguyên mẫu sang giai đoạn ứng dụng thực tế.
API mở có ý nghĩa gì?
Gemini Robotics-ER 1.6 được mở cho các nhà phát triển thông qua Gemini API và Google AI Studio. Cách phân phối này rất quan trọng.
Các nhà sản xuất phần cứng (không chỉ Boston Dynamics) giờ đây có thể gọi trực tiếp mô hình này, tích hợp suy luận thị giác tiên tiến vào nền tảng robot của riêng họ – không cần tự đào tạo, không cần duy trì trọng số mô hình, chỉ cần gọi API. Điều này hạ thấp đáng kể rào cản gia nhập và cho phép AI robot của DeepMind thâm nhập nhanh hơn vào các tình huống công nghiệp khác nhau.
Điều này khác với logic của Waymo, nơi dữ liệu lái thử được tích lũy thành hào bảo vệ: DeepMind đi theo con đường nền tảng, cho phép các đối tác phần cứng bên thứ ba phổ biến khả năng. Robot nào sử dụng nó, robot đó sẽ có thêm một khả năng có thể thương mại hóa trực tiếp trong kiểm tra công nghiệp.
Robot công nghiệp có thể còn một chặng đường nữa để đạt đến "vào nhà máy mà không cần một người nào đi theo", nhưng việc Spot có thể đọc đồng hồ đo đã là một bước tiến đến gần hơn.
Nguồn tham khảo: Gemini Robotics ER 1.6: Enhanced Embodied Reasoning (Google DeepMind Blog); DeepMind launches Gemini Robotics-ER 1.6 to meet precise physical AI demands (SiliconANGLE); CocoLoop, Google DeepMind Releases Gemini Robotics-ER 1.6 (MarkTechPost)