Robot có thể nhìn, nhưng nhiều thao tác hỏng ở đầu ngón tay. NeoteAI và nhóm TEAI của Đại học Fudan đã công bố ba báo cáo kỹ thuật N0: N0-Foundation, N0-VTLA và N0-TWAM, kèm trang nghiên cứu, dữ liệu, mã nguồn và checkpoint.
Xúc giác thành lớp dữ liệu
N0-Foundation cho biết NeoData có hơn 30.000 giờ tương tác thị giác-xúc giác, 1,4 triệu episode, 3,3 tỷ timestep, 8 tỷ khung RGB và 10 tỷ khung xúc giác. Bộ dữ liệu phủ sáu embodiment và hơn 450 nhiệm vụ.
Phần mở hiện có 5.000 giờ, gồm sáu embodiment, hơn 250 nhiệm vụ và hơn 200 kỹ năng. Đây là điểm bắt đầu có ích cho tái lập, nhưng phần lớn bộ dữ liệu đầy đủ vẫn chưa được công khai.
Mô hình dự đoán lần chạm kế tiếp
N0-VTLA không chỉ ghép ảnh xúc giác vào ảnh camera. Nó nén tiếp xúc hiện tại thành token xúc giác ẩn, rồi dự đoán xúc giác sẽ đổi thế nào trong đoạn hành động tiếp theo. Robot vì vậy ước lượng trượt, kẹt hoặc cắm khớp trước khi động tác kết thúc.
Theo báo cáo của nhóm, N0-VTLA đạt trung bình 47,2% trên chín nhiệm vụ robot thật NeoReal, so với 29,4% của baseline pi0.5. Cắm phích đạt 85% so với 60%, còn board insertion tăng từ 0 của hai baseline lên 25%.
World model có cả cảm giác
N0-TWAM sinh video tương lai, xúc giác tương lai và hành động trong cùng một world-action model. Mô hình có 7,16B tham số huấn luyện được và được tiền huấn luyện 30.000 bước trên 128 GPU H800.
Tỷ lệ thành công trung bình được báo cáo là 84,5% trên UniVTAC, 49,4% trên NeoSim và 46,3% trên tám nhiệm vụ robot thật. Điểm cần theo dõi là tái lập độc lập, bài nộp bên ngoài cho NeoReal/NeoSim, và khả năng sản xuất cùng hiệu chuẩn cảm biến xúc giác ổn định.
Nguồn: QbitAI, báo cáo kỹ thuật NeoteAI/Fudan N0-Foundation, báo cáo kỹ thuật N0-VTLA, báo cáo kỹ thuật N0-TWAM, bộ dữ liệu Hugging Face, kho mã GitHub, CocoLoop; kiểm chứng 30.000 giờ tương tác, 1,4 triệu episode, 3,3 tỷ timestep, 8 tỷ khung RGB, 10 tỷ khung xúc giác, phần mở 5.000 giờ, tỷ lệ thành công NeoReal, N0-TWAM 7,16B tham số, 128 H800 và phạm vi benchmark.