SenseTime abre el código de U1.5, el modelo de 8B genera imágenes 4K nativas de forma directa

El 20 de agosto, SenseTime etiquetó la versión oficial de SenseNova-U1.5-8B-MoT en GitHub, con licencia Apache 2.0, y los pesos se publicaron simultáneamente en Hugging Face y ModelScope. Esto ocurre tres semanas después de la versión Preview del 31 de julio, y menos de cuatro meses después de que esta línea de productos se abriera por primera vez (U1-8B-MoT, el 27 de abril de este año).

La nueva versión apuesta por dos ejes principales: generación nativa de imágenes en 4K, e integrar la edición de imagen y el control preciso en un solo modelo.

Un modelo, tres formas de contar parámetros

Primero, un detalle que confunde con facilidad. El nombre del modelo incluye 8B; el README del repositorio añade una nota aclarando que 8B-MoT se refiere a unos 8.000 millones de parámetros de comprensión más unos 8.000 millones de parámetros de generación; mientras que la ficha del modelo en Hugging Face indica una escala de tensores de 18.000 millones, con precisión F32 y BF16.

Las tres cifras son correctas, solo que cuentan cosas distintas. MoT son las siglas de Mixture of Transformers; en esta arquitectura de SenseTime, comprensión y generación operan en torres separadas que se alternan sobre la misma secuencia. Si la torre de comprensión y la de generación deben sumarse, si solo debe reportarse la escala activada, o si deben listarse por separado, todavía no existe una convención en la industria: cada empresa lo hace a su manera en las páginas de lanzamiento de sus modelos multimodales unificados.

El impacto práctico para los desarrolladores es que comparar estos modelos únicamente por el número de parámetros tiene cada vez menos valor de referencia. Para comparar de verdad hay que ver si caben en una sola GPU, cuánto tarda en generar una imagen en 4K y cuál es el pico de uso de memoria de vídeo. Estos datos SenseTime no los ha unificado esta vez en la página de lanzamiento.

Generación directa en 4K, no ampliación posterior

La expresión 4K nativo requiere matizarse. Actualmente hay dos caminos habituales para llevar una imagen a 4K: uno en el que el modelo primero genera una imagen de menor resolución que luego se entrega a un modelo de ampliación para regenerar los detalles; y otro en el que el propio modelo generador trabaja directamente en la resolución objetivo.

La diferencia entre ambos caminos no está en el número final de píxeles, sino en la coherencia estructural. Con el camino de ampliación, la composición global ya queda fijada en la fase de baja resolución, y la ampliación solo puede añadir detalle; ante texto denso, disposiciones complejas o múltiples sujetos, es fácil que aparezcan desajustes al ampliar. Esta vez SenseTime incorporó el 4K directamente en la generación; la descripción oficial afirma que se logra “tanto la composición general como texturas extremadamente finas y detalles microscópicos”, y subraya que la eficiencia de generación en 4K mejoró en esta versión.

De las seis mejoras visibles para el usuario que aparecen en la página de lanzamiento, aparte del 4K, las otras cinco giran en torno a la controlabilidad: la composición, los materiales y la iluminación de las imágenes generadas se acercan más a fotografías reales; la edición nativa de imagen preserva mejor la identidad del sujeto y la estructura espacial; mejora la legibilidad del texto en chino e inglés y de disposiciones complejas como infografías y carteles; el seguimiento de instrucciones complejas sobre cantidad de objetos y relaciones espaciales es más estable; se pueden usar cuadros de detección, marcas visuales y referencias de múltiples imágenes para un control preciso.

Este último punto resulta especialmente útil para los equipos que desarrollan herramientas de diseño. Usar cuadros y marcas para indicar “cambia esto aquí” es mucho más práctico que ajustar repetidamente el prompt para describir la posición, y también es más fácil de integrar en interfaces de edición ya existentes.

Las limitaciones conocidas, expuestas en la página de lanzamiento

En la segunda mitad de la ficha del modelo hay una sección que enumera cinco problemas aún sin resolver: los detalles tienden a exagerarse, el texto denso todavía puede fallar, el rendimiento es inestable con disposiciones restringidas, los detalles de los personajes son poco consistentes, y las ediciones complejas pueden provocar deriva.

En el material de lanzamiento de los modelos de código abierto chinos no es habitual exponer esta sección de forma voluntaria. Su función va más allá de transmitir honestidad. Estos cinco puntos son, básicamente, los retos comunes actuales de este tipo de modelos; enunciarlos ahorra a quienes los usan una ronda de prueba y error, y deja además una base de referencia para comparar con futuras versiones.

En el mismo periodo también se lanzó SenseNova-U1.5-8B-MoT-LoRA-8step, una versión destilada en 8 pasos con 0,4B de parámetros, pensada para escenarios sensibles a la latencia. Sumado a la licencia Apache 2.0 —que permite uso comercial y no incluye cláusulas de contagio— y a la disponibilidad en tres plataformas (GitHub, Hugging Face y ModelScope), este lanzamiento ha reducido prácticamente al máximo las barreras de acceso que se podían reducir.

Lo que queda vuelve al mismo punto de siempre: los pesos abiertos resuelven si se puede o no conseguir el modelo, pero no resuelven si se puede o no ejecutarlo. Una estructura de doble torre de 8B más 8B que genera 4K de forma directa no tendrá un consumo bajo de memoria de vídeo; cuántos equipos lleguen a usarlo seguirá dependiendo de si esa única GPU es suficiente.

Fuentes: repositorio de GitHub OpenSenseNova/SenseNova-U1, CocoLoop, ficha del modelo en Hugging Face, IT Home