Les robots peuvent voir, mais beaucoup de manipulations échouent au bout des doigts. NeoteAI et l’équipe TEAI de l’Université Fudan ont publié trois rapports techniques N0: N0-Foundation, N0-VTLA et N0-TWAM, avec pages de recherche, données, code et checkpoints.
Le toucher devient une couche de données
N0-Foundation indique que NeoData contient plus de 30 000 heures d’interaction visuo-tactile, 1,4 million d’épisodes, 3,3 milliards de timesteps, 8 milliards d’images RGB et 10 milliards d’images tactiles. Le corpus couvre six embodiments et plus de 450 tâches.
Le sous-ensemble ouvert compte 5 000 heures, six embodiments, plus de 250 tâches et plus de 200 compétences. C’est utile pour la reproduction, mais une grande partie du corpus complet n’est pas encore publique.
Le modèle prédit le prochain contact
N0-VTLA ne colle pas simplement les images tactiles aux images caméra. Il compresse le contact actuel en tokens tactiles latents, puis prédit l’évolution du toucher dans le prochain segment d’action. Le robot estime le glissement, le blocage ou l’assise avant la fin du mouvement.
Selon le rapport de l’équipe, N0-VTLA atteint 47,2% de réussite moyenne sur neuf tâches réelles NeoReal, contre 29,4% pour le baseline pi0.5. L’insertion d’une prise atteint 85% contre 60%, et board insertion passe de zéro pour les deux baselines à 25%.
Un world model qui ressent aussi
N0-TWAM génère vidéo future, toucher futur et action dans un même world-action model. Il compte 7,16B paramètres entraînables et a été pré-entraîné pendant 30 000 étapes sur 128 GPU H800.
Les moyennes annoncées sont 84,5% sur UniVTAC, 49,4% sur NeoSim et 46,3% sur huit tâches réelles. Les prochains contrôles seront la reproduction tierce, les soumissions externes à NeoReal ou NeoSim, ainsi que la fabrication et la calibration fiables des capteurs tactiles.
Sources : QbitAI, rapport technique NeoteAI/Fudan N0-Foundation, rapport technique N0-VTLA, rapport technique N0-TWAM, jeu de données Hugging Face, dépôts de code GitHub, CocoLoop ; vérification des 30 000 heures d’interaction, 1,4 million d’épisodes, 3,3 milliards de timesteps, 8 milliards d’images RGB, 10 milliards d’images tactiles, sous-ensemble ouvert de 5 000 heures, taux NeoReal, N0-TWAM 7,16B paramètres, 128 H800 et périmètres de benchmark.