MiniCPM leva modelos de robôs para o dispositivo

O novo lançamento de robótica da OpenBMB não começa aumentando o modelo. A pergunta inicial é mais prática: o robô consegue continuar agindo quando a rede é fraca e o computador embarcado é pequeno?

O MiniCPM-Robot foi publicado no GitHub em 19 de julho. Os dois primeiros modelos dividem o trabalho: MiniCPM-RobotManip é um VLA 1.5B para manipulação; MiniCPM-RobotTrack é um modelo 0.9B para seguir alvos e navegar. O PhyAI, framework de inferência para physical AI, também acompanha o pacote.

Latência vem primeiro

O README oficial informa que o MiniCPM-RobotManip marcou 97.5 no LIBERO easy e 91.3/91.6 no RoboTwin2 clean/random. No RMBench, que mede memória sobre observações anteriores, o modelo chega a 53.3, contra 10.4 do π0.5. O card do modelo também diz que os tokens visuais caem de 256 para 64 por frame e que a latência model-forward no H100 BF16 é de cerca de 120 ms por decisão, contra 234 ms do π0.5.

Em tarefas longas, outro número pesa mais. Com 60 frames de histórico, a recomputação tradicional usa cerca de 125 TFLOPs por passo; a inferência em streaming usa 3.3 TFLOPs. Em conta simples, é uma redução superior a 97% na computação por passo. Em um braço robótico, isso aparece como movimento mais contínuo.

O robô precisa seguir localmente

O MiniCPM-RobotTrack mira um cenário mais físico. Um Unitree Go2 Edu segue uma pessoa usando linguagem e visão. As taxas reportadas são 89.8%, 73.4% e 80.4% em alvo único, interferência de várias pessoas e alvo ambíguo. A pilha de implantação também é explícita: Go2 Edu, Jetson Orin NX 16GB, Jetson Linux R36.5, CUDA 12.6, TensorRT 10.7 e ROS 2 Humble. O loop local end-to-end roda a 5+ FPS com cerca de 180 ms.

Latência de chamada em nuvem e latência de controle local não são a mesma coisa. Dentro de um elevador ou garagem subterrânea, câmera, encoder, modelo, waypoints e comandos precisam continuar no dispositivo.

Código aberto precisa ser executável

A publicação inclui pesos, exemplos de inferência, notas de implantação no Go2, instruções de ambiente e padrões de segurança; os cards do Hugging Face mostram licença Apache-2.0. O PhyAI cobre a camada de engenharia. A QbitAI relatou aceleração de 2.85x, 1.82x e 2.28x para π0, π0.5 e GR00T no RTX 5090; no MiniCPM-Robot, CUDA Graph elevou o throughput de 10.12Hz para 33.28Hz e kernels fundidos no NVIDIA H20 levaram a 36.77Hz.

Yao Yuan disse que muitos demos de robôs ainda são otimizados em torno de uma única tarefa, então a demonstração não representa por si só o avanço de um modelo de base.

O próximo teste não é o vídeo de lançamento. Será ver se equipes externas reproduzem os números, levam os modelos para além do Go2 e publicam resultados longos em inspeção, orientação ou tarefas de armazém.

Fontes: QbitAI; README do OpenBMB no GitHub para status de lançamento, licença Apache-2.0 e métricas LIBERO/Calvin/RoboTwin/RMBench e EVT-Bench; cards do Hugging Face para pesos Manip/Track e notas de inferência local, CocoLoop, página da organização OpenBMB para estado de atualização dos modelos.