Un vídeo de demostración de entre tres y doce segundos, junto con los datos de movimiento grabados en sincronía, se introduce directamente en la ventana de contexto del modelo, y el robot pasa a ejecutar una tarea que nunca había practicado: sin actualización de gradientes, sin ajuste fino, sin mover un solo peso. Generalist AI llama a esto "physical prompting" y lo presenta junto con su nuevo modelo, GEN-1.5.
GEN-1.5 es un modelo multimodal de gran tamaño que procesa cuatro tipos de entrada —vídeo, lecturas de sensores, instrucciones en lenguaje natural y propiocepción—, mantiene una ventana de memoria de 30 segundos y genera trayectorias de movimiento a 100 Hz. Según el equipo, el sistema lleva más de ocho meses entrenándose de forma continua en su motor de datos.
Tres cifras marcan el rango
La compañía probó el sistema en 10 tareas de manipulación —abrir un frasco de vidrio, bajar la cremallera de un estuche, sacar dinero de una cartera, entre otras—. Con una sola demostración como prompt de contexto, la tasa de éxito media fue del 59% (desviación estándar de ±10 puntos). Al recopilar en cambio cinco minutos de datos por tarea —unas 50 demostraciones— y aplicar diez pasos de actualización de gradiente, el resultado subió al 83% (±9 puntos). En una tarea reservada para pruebas, con un solo paso de adaptación, la cifra fue del 66,5%.
Esa diferencia de 24 puntos porcentuales cuesta cinco minutos de recopilación más una ronda de cola de entrenamiento. Para una línea de producción que cambia de pieza decenas de veces, la cuenta es sencilla: la ruta del ajuste fino exige repetir todo el ciclo de recopilación y entrenamiento cada vez que cambia el SKU, mientras que el prompting en contexto se resuelve en segundos. Aun así, un 59% queda lejos de la operación autónoma; por ahora funciona más bien como un atajo que evita reprogramar en escenarios de colaboración humano-robot.
Puesto junto al enfoque de sus pares chinos, la diferencia salta a la vista. Empresas como Alibaba, AgiBot (Zhiyuan) y Unitree han centrado el último año en ampliar datos y perfeccionar el hardware, apoyándose en enormes volúmenes de teleoperación para elevar la tasa de éxito en tareas concretas, aunque cada tarea nueva obliga a repetir el ciclo de recopilación y entrenamiento. GEN-1.5 opta por otro camino: renuncia al pico de rendimiento en una sola tarea a cambio de libertad para cambiar de tarea sin tocar los pesos. Haciendo números a grandes rasgos, si una fábrica necesita poner en marcha entre tres y cinco estaciones nuevas cada semana, ambos enfoques pueden diferir en un orden de magnitud en el coste de personal durante el despliegue.
Hasta el propio equipo se sorprendió
"Inserting a single demonstration in the context buffer... yields any measurable competence at all was unexpected."
En español: que insertar una sola demostración en el búfer de contexto produjera siquiera una competencia medible fue algo inesperado. Esta frase resume la magnitud del hallazgo. El aprendizaje en contexto de los modelos de lenguaje "emergió" en su momento con GPT-3 sin que nadie lo entrenara para ello de forma específica; lo que Generalist reporta ahora es ese mismo tipo de emergencia, pero del lado de los sensores y los ángulos de las articulaciones. La compañía fue fundada en 2024 por antiguos investigadores de DeepMind y Boston Dynamics, y previamente había levantado 400 millones de dólares en financiación.
Los límites que la propia empresa reconoce
El anuncio no elude varias carencias: las tareas de prueba son todas cortas y simples, por lo que la tasa de éxito no es especialmente llamativa; las habilidades aprendidas en contexto resultan mucho más frágiles que las de un modelo ajustado con fine-tuning; y el physical prompting introduce además saltos temporales que el modelo nunca vio durante el entrenamiento, generando una discontinuidad entre el fragmento de demostración y la ejecución real.
Sumadas, estas limitaciones apuntan a una misma conclusión: aprender una habilidad nueva a partir de una sola demostración apenas empieza a asomar. Que aguante en tareas de largo alcance y se mantenga estable en entornos desordenados dependerá de cuánto logren elevar el 59% las próximas versiones.
Fuentes: anuncio oficial de GEN-1.5 en el blog de Generalist AI, IoT Tech News, CocoLoop; las cifras del 59% con una sola demostración, el 83% tras el ajuste fino, el 66,5% en la tarea reservada, así como la ventana de memoria de 30 segundos y la frecuencia de movimiento de 100 Hz, siguen todas el anuncio oficial.