MiniCPM met les modèles robotiques sur l'appareil

La nouvelle publication robotique d'OpenBMB ne commence pas par grossir le modèle. Elle pose d'abord une question pratique: un robot peut-il continuer à agir quand le réseau est faible et que le calcul embarqué reste limité?

MiniCPM-Robot a été publié sur GitHub le 19 juillet. Les deux premiers modèles se partagent le travail: MiniCPM-RobotManip est un modèle VLA 1.5B pour la manipulation, tandis que MiniCPM-RobotTrack est un modèle 0.9B pour le suivi et la navigation. PhyAI, framework d'inférence pour physical AI, arrive avec eux.

La latence passe en premier

Le README officiel indique 97.5 sur LIBERO easy et 91.3/91.6 sur RoboTwin2 clean/random pour MiniCPM-RobotManip. Sur RMBench, qui teste la mémoire des observations précédentes, le modèle atteint 53.3 contre 10.4 pour π0.5. La fiche modèle indique aussi une compression des tokens visuels de 256 à 64 par image et une latence model-forward d'environ 120 ms par décision sur H100 BF16, contre 234 ms pour π0.5.

Pour les longues tâches, un autre chiffre compte davantage. Avec 60 images d'historique, le recalcul traditionnel demande environ 125 TFLOPs par étape; l'inférence en streaming demande 3.3 TFLOPs. Cela revient à une baisse d'environ 97% du calcul par étape. Sur un bras robotique, l'écart se traduit par un mouvement plus continu.

Le robot doit suivre localement

MiniCPM-RobotTrack vise un usage plus terrain. Un Unitree Go2 Edu suit une personne avec instruction en langage naturel et vision. Les taux de suivi rapportés sont 89.8%, 73.4% et 80.4% pour cible unique, distracteurs multiples et cible ambiguë. La pile de déploiement est également détaillée: Go2 Edu, Jetson Orin NX 16GB, Jetson Linux R36.5, CUDA 12.6, TensorRT 10.7 et ROS 2 Humble. La boucle locale de bout en bout tourne à 5+ FPS avec environ 180 ms de latence.

La latence d'un appel cloud et celle du contrôle de mouvement local ne mesurent pas la même chose. Dans un ascenseur ou un parking souterrain, caméra, encodeur, modèle, waypoints et commandes doivent rester dans la boucle embarquée.

L'open source doit être exécutable

La publication inclut les poids, des exemples d'inférence, des notes de déploiement Go2, des instructions d'environnement et des réglages de sécurité; les fiches Hugging Face affichent Apache-2.0. PhyAI complète la couche d'ingénierie. QbitAI rapporte des accélérations de 2.85x, 1.82x et 2.28x pour π0, π0.5 et GR00T sur RTX 5090; pour MiniCPM-Robot, CUDA Graph fait passer le débit de 10.12Hz à 33.28Hz, puis des kernels fusionnés sur NVIDIA H20 le portent à 36.77Hz.

Yao Yuan explique que beaucoup de démonstrations robotiques restent optimisées autour d'une seule tâche; elles ne suffisent donc pas à mesurer l'avancement d'un modèle de base.

Le prochain test ne sera pas une vidéo de lancement. Il faudra voir si des équipes externes reproduisent les chiffres, portent les modèles au-delà du Go2 et publient des résultats longs en inspection, guidage ou entrepôt.

Sources: QbitAI; README GitHub OpenBMB pour le statut de publication, la licence Apache-2.0, les métriques LIBERO/Calvin/RoboTwin/RMBench et EVT-Bench; fiches Hugging Face pour les poids Manip/Track et les notes d'inférence locale, CocoLoop, page d'organisation OpenBMB pour l'état de mise à jour des modèles.