El nuevo lanzamiento robótico de OpenBMB no empieza con un modelo más grande. Empieza con una pregunta práctica: si la red falla y el ordenador del robot es limitado, ¿puede seguir actuando?
MiniCPM-Robot se publicó en GitHub el 19 de julio. Los dos primeros modelos dividen el trabajo: MiniCPM-RobotManip es un modelo VLA 1.5B para manipulación, mientras MiniCPM-RobotTrack es un modelo 0.9B para seguimiento y navegación. PhyAI, un framework de inferencia para physical AI, se publica junto a ellos.
La latencia es la primera prueba
El README oficial reporta 97.5 en LIBERO easy y 91.3/91.6 en RoboTwin2 clean/random para MiniCPM-RobotManip. En RMBench, que mide memoria sobre observaciones previas, el modelo alcanza 53.3 frente a 10.4 de π0.5. La tarjeta del modelo también indica compresión de tokens visuales de 256 a 64 por frame y una latencia model-forward de unos 120 ms por decisión en H100 BF16, frente a 234 ms de π0.5.
Para tareas largas, otro número pesa más: con 60 frames de historial, la recomputación tradicional consume unos 125 TFLOPs por paso, mientras la inferencia en streaming consume 3.3 TFLOPs. Es una reducción aproximada superior al 97%. En un brazo robótico, esa diferencia se nota en la continuidad del movimiento.
El robot debe seguir localmente
MiniCPM-RobotTrack se acerca más al terreno. Un Unitree Go2 Edu sigue a una persona usando lenguaje y visión. Las tasas reportadas son 89.8%, 73.4% y 80.4% en tareas de objetivo único, múltiples distractores y objetivo ambiguo. La pila de despliegue también está detallada: Go2 Edu, Jetson Orin NX 16GB, Jetson Linux R36.5, CUDA 12.6, TensorRT 10.7 y ROS 2 Humble. El bucle local end-to-end corre a 5+ FPS con unos 180 ms de latencia.
La latencia de una llamada cloud y la latencia del control local no son el mismo indicador. Si el robot entra en un ascensor o un aparcamiento subterráneo, cámara, codificador, modelo, waypoints y comandos deben seguir dentro del dispositivo.
El open source debe poder ejecutarse
La publicación incluye pesos, ejemplos de inferencia, notas de despliegue en Go2, instrucciones de entorno y valores de seguridad por defecto; las tarjetas de Hugging Face muestran licencia Apache-2.0. PhyAI aporta la capa de ingeniería. QbitAI reportó aceleraciones de 2.85x, 1.82x y 2.28x para π0, π0.5 y GR00T en RTX 5090; para MiniCPM-Robot, CUDA Graph elevó el throughput de 10.12Hz a 33.28Hz y los kernels fusionados en NVIDIA H20 lo llevaron a 36.77Hz.
Yao Yuan señaló que muchas demos robóticas aún se optimizan alrededor de una sola tarea, por lo que la demostración no refleja por completo el progreso de un modelo base.
La siguiente prueba no será el video de lanzamiento. Será comprobar si equipos externos reproducen las cifras, portan los modelos más allá de Go2 y publican resultados prolongados en inspección, guía o almacenes.
Fuentes: QbitAI; README de OpenBMB en GitHub para estado de publicación, licencia Apache-2.0 y métricas LIBERO/Calvin/RoboTwin/RMBench y EVT-Bench; tarjetas de Hugging Face para pesos Manip/Track y notas de inferencia local, CocoLoop, página de organización OpenBMB para estado de actualización de modelos.