机器人这轮模型竞赛,面壁智能没有把参数表拉到最大,先把模型压到了能贴近机器本体的位置。
7月19日,OpenBMB在GitHub公开MiniCPM-Robot系列。两套首发模型分工很清楚:1.5B的MiniCPM-RobotManip管机械臂操作,0.9B的MiniCPM-RobotTrack管机器狗跟踪导航。和它们一起放出来的,还有面向Physical AI部署的PhyAI推理框架。
这条新闻的张力,落在一个现实问题上:机器人离开展台以后,经常卡在网络、延迟、硬件算力和失败恢复上。一个大模型能在云端看懂画面,不等于它能在电梯、地下停车场或工厂弱网区把动作接上。
小模型先回答延迟
MiniCPM-RobotManip的定位是通用VLA模型,输入图像和指令,输出机器人动作。官方README给出的评测表显示,它在LIBERO easy上达到97.5,在RoboTwin2 clean+random上达到91.3/91.6;专门考机器人“记住前面发生过什么”的RMBench里,MiniCPM-RobotManip为53.3,π0.5为10.4。
分数之外,更硬的是单步成本。OpenBMB写明,模型继承MiniCPM-V 4.6的视觉token压缩,把每帧视觉token从256压到64;在H100、BF16、单帧输入口径下,单次决策的model-forward延迟约120毫秒,π0.5约234毫秒。官方同时给出另一组计算量口径:保留60帧历史时,传统重算每步约125 TFLOPs,流式推理约3.3 TFLOPs。
粗算一下,3.3对125,相当于单步计算量降到约2.6%,降幅超过97%。这背后的原因并非单纯模型变小,历史画面不用每步从头算才是主线。对机械臂来说,几百毫秒的差别会直接变成动作卡顿、抓取失败或任务时间拉长。
机器狗要在本地跟住人
另一套MiniCPM-RobotTrack更贴近现场。它基于MiniCPM4-0.5B,用自然语言指令加视觉特征,直接预测8个未来路点,让宇树Go2 Edu跟随指定目标。
官方和量子位列出的EVT-Bench结果里,MiniCPM-RobotTrack在三类任务上的跟踪率分别是89.8%、73.4%和80.4%。这三类任务覆盖单目标跟踪、多人干扰和模糊目标描述。GitHub README还把真实部署栈写得很细:Go2 Edu、Jetson Orin NX 16GB、Jetson Linux R36.5、CUDA 12.6、TensorRT 10.7、ROS 2 Humble;端到端链路在Go2本地算力上稳定5+ FPS,延迟约180毫秒。
这个口径很重要。云端调用延迟和本地运动控制延迟不能混在一起看。机器狗进电梯后还要认人、避障、继续走,靠的是摄像头采集、视觉编码、模型推理、动作生成和指令传输一整条链路都压住,而不只是模型单次跑分。
开源价值在复现链路
这次开源的看点不止权重。仓库给了两个模型的推理示例、Go2部署说明、环境依赖和安全提示;Hugging Face模型卡显示两个模型均以Apache-2.0协议公开。对开发者而言,能不能把权重拿下来跑,和论文里的曲线一样影响采用速度。
PhyAI则负责另一半工程问题。量子位披露,PhyAI在RTX 5090上运行π0、π0.5和GR00T时,相比各自官方仓库实现约2.85倍、1.82倍和2.28倍加速;适配MiniCPM-Robot系列后,先用CUDA Graph把推理帧率从10.12Hz推到33.28Hz,再用融合算子在NVIDIA H20上拉到36.77Hz。OpenBMB的README也记录了“从10Hz到37Hz”的Day-0支持节点。
这组数字把面壁的路线和近期几篇国产机器人模型新闻区分开了。阿里Qwen-Robot套件强调跨本体模型,小米把焦点放在10万小时真实轨迹和大模型规模扩展;MiniCPM-Robot的入口更窄:把具身模型压小、压快,再把部署说明放出来。它不保证马上进入工厂,但给外部团队留下了可复现起点。
Demo之外还要看失败恢复
清华大学人工智能学院助理教授、面壁智能多模态首席科学家姚远在访谈里说:
现阶段不少机器人Demo会围绕单一任务采集大量数据,再进行针对性优化,展示效果并不能完全代表基础模型的真实进度。面壁更看重模型的基础性、泛化性和通用性,希望先把数据、Infra和工程链路打磨好,让基础能力提升后自然覆盖更多场景。沿着大语言模型的发展经验,具身智能最终也要走向“先通后专”,先理解物理世界的基本常识,再成为做饭、叠衣服或仓储作业等具体领域的专家。
这段话把限制也摆了出来。MiniCPM-Robot现在能证明的是:小参数量模型在若干公开评测、演示任务和本地部署链路上已经拿到一组可查数字。它还没有证明的是长时间无人值守、复杂工厂班次、硬件磨损和异常恢复。
后续看三个指标就够了:GitHub和Hugging Face下载后的复现案例,Go2之外的更多机器人本体适配,以及合作方在园区巡检、展厅导览、仓储任务里公开的连续运行数据。机器人模型走向真实场景,最后不能只看一次Demo有多顺,还要看掉链子以后能不能自己接回来。
参考来源:量子位;OpenBMB GitHub README 核验开源节点、Apache-2.0 协议、LIBERO/Calvin/RoboTwin/RMBench 与 EVT-Bench 评测口径;Hugging Face 模型卡核验 Manip/Track 权重与本地推理说明、CocoLoop、OpenBMB 组织页核验模型更新状态。