Rilis robot terbaru OpenBMB tidak dimulai dari model yang makin besar. Pertanyaan utamanya lebih praktis: apakah robot tetap bisa bergerak ketika jaringan lemah dan komputer di badannya terbatas.
MiniCPM-Robot dipublikasikan di GitHub pada 19 Juli. Dua model pertamanya membagi tugas dengan jelas: MiniCPM-RobotManip adalah model VLA 1.5B untuk manipulasi, sedangkan MiniCPM-RobotTrack adalah model 0.9B untuk mengikuti target dan navigasi. PhyAI, framework inferensi untuk deployment physical AI, ikut dirilis.
Latensi jadi ujian pertama
README resmi mencatat MiniCPM-RobotManip meraih 97.5 di LIBERO easy dan 91.3/91.6 di RoboTwin2 clean/random. Di RMBench, yang menguji memori terhadap observasi sebelumnya, nilainya 53.3, dibanding 10.4 untuk π0.5. Kartu model juga menyebut kompresi token visual dari 256 menjadi 64 per frame, serta latensi model-forward sekitar 120 ms per langkah keputusan pada H100 BF16, dibanding 234 ms untuk π0.5.
Untuk tugas panjang, angka komputasi lebih berbicara. Dengan riwayat 60 frame, rekalkulasi tradisional membutuhkan sekitar 125 TFLOPs per langkah, sedangkan streaming inference membutuhkan 3.3 TFLOPs. Secara kasar, komputasi per langkah turun lebih dari 97%. Pada lengan robot, selisih itu berubah menjadi gerak yang lebih mulus.
Robot berkaki harus mengikuti secara lokal
MiniCPM-RobotTrack lebih dekat dengan lapangan. Unitree Go2 Edu mengikuti orang dari instruksi bahasa dan visi. Tingkat pelacakan yang dilaporkan adalah 89.8%, 73.4% dan 80.4% untuk target tunggal, gangguan banyak orang, dan deskripsi target ambigu. Stack deployment juga disebut rinci: Go2 Edu, Jetson Orin NX 16GB, Jetson Linux R36.5, CUDA 12.6, TensorRT 10.7 dan ROS 2 Humble. Loop lokal end-to-end berjalan 5+ FPS dengan latensi sekitar 180 ms.
Latensi panggilan cloud dan latensi kontrol gerak lokal bukan metrik yang sama. Saat robot masuk lift atau parkiran bawah tanah, kamera, encoder, model, output waypoint dan jalur komando harus tetap berada di loop lokal.
Open source harus bisa dijalankan
Rilis ini mencakup bobot, contoh inferensi, catatan deployment Go2, instruksi environment dan default keselamatan; kartu Hugging Face menampilkan lisensi Apache-2.0. PhyAI menutup lapisan rekayasa. QbitAI melaporkan percepatan 2.85x, 1.82x dan 2.28x untuk π0, π0.5 dan GR00T di RTX 5090, lalu throughput MiniCPM-Robot naik dari 10.12Hz ke 33.28Hz dengan CUDA Graph dan 36.77Hz di NVIDIA H20 dengan fused kernels.
Yao Yuan mengatakan banyak demo robot masih dioptimalkan untuk satu tugas dengan data khusus, sehingga video demo tidak selalu mewakili kemajuan model dasar.
Ujian berikutnya bukan video peluncuran. Yang perlu dilihat adalah apakah tim luar dapat mereproduksi angka ini, memindahkannya ke robot selain Go2, dan mempublikasikan data berjalan lama untuk inspeksi, pemanduan, atau tugas gudang.
Sumber: QbitAI; README GitHub OpenBMB untuk status rilis, lisensi Apache-2.0, metrik LIBERO/Calvin/RoboTwin/RMBench dan EVT-Bench; kartu model Hugging Face untuk bobot Manip/Track dan catatan inferensi lokal, CocoLoop, halaman organisasi OpenBMB untuk status pembaruan model.