面壁開源1.5B端側機器人模型

機器人模型這一輪競賽,面壁智能沒有先把參數表拉到最大,先把模型壓到更接近機器本體的位置。

7月19日,OpenBMB在GitHub公開MiniCPM-Robot系列。兩套首發模型分工清楚:1.5B的MiniCPM-RobotManip管機械臂操作,0.9B的MiniCPM-RobotTrack管機器狗追蹤導航。同時亮相的還有面向Physical AI部署的PhyAI推理框架。

延遲先上考場

官方README顯示,MiniCPM-RobotManip在LIBERO easy上達到97.5,在RoboTwin2 clean/random上達到91.3/91.6;考察上下文記憶的RMBench裡,MiniCPM-RobotManip為53.3,π0.5為10.4。模型卡還寫明,它把每幀視覺token從256壓到64;在H100、BF16、單幀輸入口徑下,單次決策的model-forward延遲約120毫秒,π0.5約234毫秒。

另一組數字更能說明長任務成本。保留60幀歷史時,傳統重算每步約125 TFLOPs,流式推理約3.3 TFLOPs。粗算相當於單步計算量降到約2.6%,降幅超過97%。對機械臂來說,這會直接影響動作銜接。

機器狗得在本地跟住人

MiniCPM-RobotTrack更貼近現場。它基於MiniCPM4-0.5B,用自然語言指令加視覺特徵,直接預測8個未來路點,讓宇樹Go2 Edu跟隨指定目標。公開數據裡,三類任務追蹤率分別為89.8%、73.4%和80.4%,覆蓋單目標、多人干擾和模糊目標描述。

GitHub README把真機部署環境也寫出來:Go2 Edu、Jetson Orin NX 16GB、Jetson Linux R36.5、CUDA 12.6、TensorRT 10.7、ROS 2 Humble;本地端到端鏈路穩定5+ FPS,延遲約180毫秒。雲端調用延遲和本地運動控制延遲不能混看。進了電梯或地下停車場,攝像頭、編碼、模型、路點和控制命令都得留在機體側。

開源要能跑起來

這次公開包含權重、推理示例、Go2部署說明、環境依賴和安全提示;Hugging Face模型卡顯示兩個模型均採Apache-2.0協議。PhyAI補的是工程層:量子位披露,它在RTX 5090上運行π0、π0.5和GR00T時分別實現約2.85倍、1.82倍和2.28倍加速;適配MiniCPM-Robot後,推理帧率從10.12Hz推到33.28Hz,再用融合算子在NVIDIA H20上拉到36.77Hz。

姚遠在訪談中表示,不少機器人Demo會圍繞單一任務採集大量數據並做針對性優化,展示效果不能完全代表基礎模型的進度。

這條路線和近期國產機器人模型新聞不同。阿里Qwen-Robot套件強調跨本體,小米強調10萬小時真實軌跡;MiniCPM-Robot的入口更窄:把具身模型壓小、壓快,再把部署鏈路放出來。後續該看的,是外部團隊能否復現、能否遷移到Go2之外的機體,以及巡檢、導覽、倉儲任務是否跑出連續數據。

參考來源:量子位;OpenBMB GitHub README核驗開源節點、Apache-2.0協議、LIBERO/Calvin/RoboTwin/RMBench與EVT-Bench評測口徑;Hugging Face模型卡核驗Manip/Track權重與本地推理說明、CocoLoop、OpenBMB組織頁核驗模型更新狀態。