機器人會看,離會做事還差一層「手感」。NeoteAI 與復旦大學可信具身智能研究院發布 N0-Foundation、N0-VTLA、N0-TWAM 三份技術報告,同步給出研究頁、資料、程式碼和 checkpoint 入口。
觸覺先變成資料底座
N0-Foundation 給出的 NeoData 規模是超過 30000 小時視覺-觸覺互動資料、140 萬條操作片段、33 億個時間步、80 億幀 RGB 畫面和 100 億幀觸覺影像。
資料覆蓋 6 種本體與 450 多項任務。已開源子集為 5000 小時,包含 6 種本體、250 多項任務和 200 多種技能。這讓外部團隊有了復現入口,但全量資料仍未完全公開。
模型開始預測下一秒會摸到什麼
N0-VTLA 沒有把觸覺影像簡單接到視覺輸入後面,處理方式是把當前接觸壓成 latent tactile tokens,再預測下一段動作中的觸覺變化。簡單說,機器人要在動作完成前估計會不會滑、會不會卡住、是否已坐實。
團隊報告中,N0-VTLA 在九個 NeoReal 真機任務平均成功率為 47.2%,π0.5 基線為 29.4%。插插頭任務達 85%,視覺方案為 60%;棋盤插入從兩個基線的 0 提升到 25%。
世界模型把「摸」也放進未來
N0-TWAM 把未來影片、未來觸覺和動作放進同一個世界動作模型。模型參數量為 7.16B,預訓練使用 128 張 H800 GPU 跑了 30000 步。
它在 UniVTAC、NeoSim 和 8 個真機任務上的平均成功率分別為 84.5%、49.4%、46.3%。後續更應看第三方復現、NeoReal/NeoSim 外部提交,以及觸覺感測器能否穩定量產與校準。
參考來源:量子位、NeoteAI/復旦 N0-Foundation 技術報告、N0-VTLA 技術報告、N0-TWAM 技術報告、Hugging Face 資料集、GitHub 程式碼倉庫、CocoLoop;核驗 3 萬小時互動資料、140 萬操作片段、33 億時間步、80 億 RGB 幀、100 億觸覺幀、5000 小時開源子集、NeoReal 成功率、N0-TWAM 7.16B 參數、128 張 H800 與各項評測口徑。