MiniCPM đưa mô hình robot lên thiết bị

Bản phát hành robot mới của OpenBMB không bắt đầu bằng câu chuyện làm mô hình lớn hơn. Nó hỏi trước một việc rất thực tế: robot có thể tiếp tục hoạt động khi mạng yếu và máy tính trên thân robot bị giới hạn hay không.

MiniCPM-Robot được công khai trên GitHub ngày 19/7. Hai mô hình đầu tiên chia việc rõ ràng: MiniCPM-RobotManip là mô hình VLA 1.5B cho thao tác, còn MiniCPM-RobotTrack là mô hình 0.9B cho theo dõi mục tiêu và điều hướng. PhyAI, framework suy luận cho triển khai physical AI, cũng đi kèm.

Độ trễ là bài kiểm tra đầu

README chính thức ghi MiniCPM-RobotManip đạt 97.5 trên LIBERO easy và 91.3/91.6 trên RoboTwin2 clean/random. Trên RMBench, nơi kiểm tra khả năng nhớ các quan sát trước đó, mô hình đạt 53.3, trong khi π0.5 là 10.4. Model card cũng cho biết token thị giác được nén từ 256 xuống 64 mỗi khung hình; trên H100 BF16 với đầu vào một khung, độ trễ model-forward mỗi bước quyết định khoảng 120 ms, so với 234 ms của π0.5.

Với tác vụ dài, con số tính toán còn rõ hơn. Khi giữ 60 khung lịch sử, cách tính lại truyền thống cần khoảng 125 TFLOPs mỗi bước, còn streaming inference cần 3.3 TFLOPs. Tính nhanh, mức giảm vượt 97%. Với cánh tay robot, khác biệt này thể hiện trực tiếp ở độ mượt của chuyển động.

Robot chó phải theo dõi tại chỗ

MiniCPM-RobotTrack gần với hiện trường hơn. Unitree Go2 Edu theo người dựa trên lệnh ngôn ngữ và hình ảnh camera. Tỷ lệ theo dõi được công bố là 89.8%, 73.4% và 80.4% ở ba nhóm nhiệm vụ: một mục tiêu, nhiều người gây nhiễu và mô tả mục tiêu mơ hồ. Stack triển khai cũng được ghi rõ: Go2 Edu, Jetson Orin NX 16GB, Jetson Linux R36.5, CUDA 12.6, TensorRT 10.7 và ROS 2 Humble. Vòng xử lý cục bộ end-to-end chạy 5+ FPS với độ trễ khoảng 180 ms.

Độ trễ gọi cloud và độ trễ điều khiển chuyển động cục bộ là hai thước đo khác nhau. Khi robot vào thang máy hoặc bãi xe ngầm, camera, encoder, mô hình, waypoint và lệnh điều khiển đều phải nằm trong vòng lặp tại chỗ.

Mã nguồn mở phải chạy được

Bản phát hành gồm trọng số, ví dụ suy luận, ghi chú triển khai Go2, hướng dẫn môi trường và mặc định an toàn; thẻ Hugging Face ghi giấy phép Apache-2.0. PhyAI xử lý lớp kỹ thuật. QbitAI cho biết π0, π0.5 và GR00T trên RTX 5090 tăng tốc lần lượt khoảng 2.85x, 1.82x và 2.28x; với MiniCPM-Robot, CUDA Graph đưa tốc độ từ 10.12Hz lên 33.28Hz, rồi fused kernels trên NVIDIA H20 đưa lên 36.77Hz.

Yao Yuan nói nhiều demo robot vẫn thu thập lượng lớn dữ liệu quanh một nhiệm vụ đơn lẻ và tối ưu riêng cho nó, nên màn trình diễn không thể hiện đầy đủ tiến độ của mô hình nền tảng.

Bài kiểm tra tiếp theo không nằm ở video ra mắt. Cần xem các nhóm bên ngoài có tái lập được số liệu hay không, mô hình có rời Go2 để sang thân máy khác hay không, và các nhiệm vụ tuần tra, hướng dẫn, kho bãi có dữ liệu chạy liên tục hay không.

Nguồn: QbitAI; README GitHub của OpenBMB để kiểm tra trạng thái phát hành, giấy phép Apache-2.0, các chỉ số LIBERO/Calvin/RoboTwin/RMBench và EVT-Bench; thẻ mô hình Hugging Face để kiểm tra trọng số Manip/Track và ghi chú suy luận cục bộ, CocoLoop, trang tổ chức OpenBMB để kiểm tra trạng thái cập nhật mô hình.