Roboter Bekommen 30.000 Stunden Tastsinn

Roboter können sehen, aber viele Handgriffe scheitern an den Fingern. NeoteAI und das TEAI-Team der Fudan University haben drei N0-Berichte veröffentlicht: N0-Foundation, N0-VTLA und N0-TWAM, mit Forschungsseiten, Daten, Code und Checkpoints.

Tastsinn Wird Zur Datenschicht

N0-Foundation meldet für NeoData mehr als 30.000 Stunden visuell-taktiler Interaktion, 1,4 Millionen Episoden, 3,3 Milliarden Zeitschritte, 8 Milliarden RGB-Frames und 10 Milliarden taktile Frames. Der Korpus umfasst sechs Körperplattformen und mehr als 450 Aufgaben.

Der offene Teil enthält 5.000 Stunden, sechs Plattformen, mehr als 250 Aufgaben und über 200 Skills. Das reicht für erste Reproduktion, doch ein großer Teil des Gesamtkorpus bleibt weiterhin nicht öffentlich.

Das Modell Sagt Den Nächsten Kontakt Voraus

N0-VTLA hängt taktile Bilder nicht einfach an Kameraframes an. Es verdichtet aktuellen Kontakt zu latenten taktilen Tokens und sagt voraus, wie sich Berührung im nächsten Aktionsabschnitt verändert. Der Roboter schätzt also Rutschen, Verklemmen oder Einrasten vor Abschluss der Bewegung.

Laut Teambericht erreicht N0-VTLA auf neun realen NeoReal-Aufgaben 47,2% durchschnittliche Erfolgsrate, gegenüber 29,4% für pi0.5. Beim Einstecken eines Steckers sind es 85% gegenüber 60%; Board Insertion steigt von null bei beiden Baselines auf 25%.

Ein Weltmodell Mit Gefühl

N0-TWAM erzeugt künftiges Video, künftige Berührung und Aktion in einem World-Action-Modell. Es hat 7,16B trainierbare Parameter und wurde 30.000 Schritte auf 128 H800-GPUs vortrainiert.

Die gemeldete Erfolgsrate liegt bei 84,5% auf UniVTAC, 49,4% auf NeoSim und 46,3% auf acht realen Roboteraufgaben. Als Nächstes zählen unabhängige Reproduktion, externe Einreichungen für NeoReal oder NeoSim sowie stabile Fertigung und Kalibrierung taktiler Sensoren.

Quellen: QbitAI, technischer Bericht NeoteAI/Fudan N0-Foundation, technischer Bericht N0-VTLA, technischer Bericht N0-TWAM, Hugging Face Datensatz, GitHub-Code-Repositories, CocoLoop; geprüft wurden 30.000 Interaktionsstunden, 1,4 Millionen Episoden, 3,3 Milliarden Zeitschritte, 8 Milliarden RGB-Frames, 10 Milliarden taktile Frames, offener 5.000-Stunden-Teil, NeoReal-Erfolgsraten, N0-TWAM mit 7,16B Parametern, 128 H800 und Benchmark-Kontext.