Los Robots Reciben 30.000 Horas De Tacto

Los robots pueden ver, pero muchas manipulaciones fallan en los dedos. NeoteAI y el equipo TEAI de la Universidad de Fudan publicaron tres informes técnicos N0: N0-Foundation, N0-VTLA y N0-TWAM, junto con páginas de investigación, datos, código y checkpoints.

El tacto se vuelve una capa de datos

N0-Foundation afirma que NeoData contiene más de 30.000 horas de interacción visual-táctil, 1,4 millones de episodios, 3,3 mil millones de timesteps, 8 mil millones de frames RGB y 10 mil millones de frames táctiles. El corpus cubre seis embodiments y más de 450 tareas.

El subconjunto abierto suma 5.000 horas, seis embodiments, más de 250 tareas y más de 200 habilidades. Es útil para reproducir parte del trabajo, aunque una porción importante del corpus completo sigue sin publicarse.

El modelo anticipa el próximo contacto

N0-VTLA no se limita a pegar imágenes táctiles a los frames de cámara. Comprime el contacto actual en tokens táctiles latentes y predice cómo cambiará el tacto en el siguiente bloque de acción. El robot intenta anticipar deslizamiento, atasco o encaje antes de terminar el movimiento.

Según el informe del equipo, N0-VTLA logra 47,2% de éxito medio en nueve tareas reales NeoReal, frente al 29,4% del baseline pi0.5. Enchufar un conector alcanza 85% frente a 60%, y board insertion sube de cero en ambos baselines a 25%.

Un world model que también siente

N0-TWAM genera video futuro, tacto futuro y acción dentro de un mismo world-action model. Tiene 7,16B parámetros entrenables y fue preentrenado durante 30.000 pasos en 128 GPU H800.

Las medias reportadas son 84,5% en UniVTAC, 49,4% en NeoSim y 46,3% en ocho tareas reales. Las siguientes comprobaciones son reproducción independiente, envíos externos a NeoReal o NeoSim, y sensores táctiles producidos y calibrados de forma estable.

Fuentes: QbitAI, informe técnico NeoteAI/Fudan N0-Foundation, informe técnico N0-VTLA, informe técnico N0-TWAM, dataset de Hugging Face, repositorios de código GitHub, CocoLoop; se verificaron 30.000 horas de interacción, 1,4 millones de episodios, 3,3 mil millones de timesteps, 8 mil millones de frames RGB, 10 mil millones de frames táctiles, subconjunto abierto de 5.000 horas, tasas NeoReal, N0-TWAM con 7,16B parámetros, 128 H800 y alcances de benchmark.