로봇은 볼 수 있어도 손끝에서 자주 실패한다. NeoteAI와 푸단대 TEAI 팀은 N0-Foundation, N0-VTLA, N0-TWAM 세 기술 보고서를 공개했다. 연구 페이지와 보고서, 데이터, 코드, 체크포인트가 함께 나왔다.
촉각이 데이터 계층이 된다
N0-Foundation의 NeoData는 3만 시간 이상의 시각-촉각 상호작용, 140만 에피소드, 33억 타임스텝, 80억 RGB 프레임, 100억 촉각 프레임을 담는다. 여섯 종류의 본체와 450개 이상의 과제를 포함한다.
공개된 부분집합은 5000시간이며, 여섯 본체, 250개 이상 과제, 200개 이상 기술을 포함한다. 재현에 의미 있는 규모지만 전체 말뭉치의 상당 부분은 아직 공개 범위 밖이다.
다음 접촉을 예측한다
N0-VTLA는 촉각 이미지를 카메라 프레임에 단순히 붙이지 않는다. 현재 접촉을 잠재 촉각 토큰으로 압축한 뒤 다음 행동 구간에서 촉각이 어떻게 변할지 예측한다. 미끄러짐, 걸림, 안착을 동작이 끝나기 전에 가늠하는 방식이다.
팀 보고서 기준으로 9개 NeoReal 실제 로봇 과제 평균 성공률은 47.2%로, pi0.5 기준선 29.4%보다 높았다. 플러그 삽입은 85% 대 60%, 보드 삽입은 두 기준선의 0에서 25%로 올라갔다.
촉감을 포함한 세계 모델
N0-TWAM은 미래 영상, 미래 촉각, 행동을 하나의 세계-행동 모델에서 생성한다. 학습 가능 파라미터는 7.16B이며, 128개 H800 GPU에서 3만 스텝 사전학습됐다.
보고된 평균 성공률은 UniVTAC 84.5%, NeoSim 49.4%, 8개 실제 로봇 과제 46.3%다. 다음 검증 포인트는 제3자 재현, NeoReal/NeoSim 외부 제출, 촉각 센서의 안정적인 제조와 보정이다.
출처: QbitAI, NeoteAI/푸단대 N0-Foundation 기술 보고서, N0-VTLA 기술 보고서, N0-TWAM 기술 보고서, Hugging Face 데이터셋, GitHub 코드 저장소, CocoLoop; 3만 시간 상호작용 데이터, 140만 에피소드, 33억 타임스텝, 80억 RGB 프레임, 100억 촉각 프레임, 5000시간 공개 부분집합, NeoReal 성공률, N0-TWAM 7.16B 파라미터, 128개 H800 및 평가 조건을 확인.