El 30 de marzo, el equipo Qwen de Alibaba lanzó Qwen3.5-Omni, su primer modelo verdaderamente multimodal: procesa texto, imágenes, audio y vídeo en un solo modelo, en lugar de una arquitectura compuesta por varios modelos especializados.
Un modelo, cuatro modalidades
Los sistemas multimodales anteriores en el mercado funcionaban principalmente bajo el principio de "división del trabajo": un modelo para la visión, otro para la audición y, finalmente, un modelo de texto para consolidar las salidas. Qwen3.5-Omni es diferente, utilizando una arquitectura dual Thinker-Talker con MoE de atención mixta (30B parámetros totales, activando 3B cada vez), con todas las modalidades ejecutándose en el mismo conjunto de parámetros.
Esto permite que el modelo realice tareas antes imposibles:
- Comprensión conjunta de audio y vídeo: Después de ver un vídeo, el modelo puede responder basándose tanto en el contenido visual como en el diálogo que contiene, sin necesidad de transcribir el audio primero.
- Clonación de voz en tiempo real: Cargue una muestra de voz y el modelo puede replicar ese timbre para salidas posteriores (actualmente accesible a través de API).
- Vibe Coding con audio y vídeo: Grabe la pantalla con explicaciones en voz alta, y Qwen3.5-Omni genera directamente el código correspondiente, sin necesidad de escribir.
Especificaciones técnicas
| Especificación | Valor |
|---|---|
| Parámetros totales | 30B MoE |
| Parámetros activados por vez | 3B |
| Ventana de contexto | 256K tokens |
| Duración máxima de audio | 10+ horas |
| Procesamiento máximo de vídeo | 400 segundos 720p @1FPS |
| Idiomas de reconocimiento de voz | 113 |
| Idiomas de salida de voz | 36 |
Tres versiones: Plus (tareas complejas de primer nivel), Flash (equilibrio entre velocidad y rendimiento), Light (ligero y rápido).
Rendimiento en benchmarks
El modelo logró SOTA en 215 conjuntos de datos de prueba y benchmarks, con la parte de audio superando directamente a Gemini 3.1 Pro:
- MMAU comprensión integral de audio: 82,2 frente a 81,1 de Gemini 3.1 Pro
- Comprensión musical RUL-MuchoMusic: 72,4 frente a 59,6, una diferencia significativa
- Estabilidad de clonación de voz multilingüe: supera a ElevenLabs, GPT-Audio y Minimax
La latencia de conversación en tiempo real se redujo a 234 milisegundos, utilizando la tecnología ARIA (Adaptive Rate Interleave Alignment) para ajustar dinámicamente el ritmo del habla, haciendo que la salida suene más natural en lugar de una lectura mecánica.
Además, las capacidades generales no se vieron afectadas: MMMU comprensión visual 82,0 %, HumanEval código 92,6 %, LibriSpeech reconocimiento de voz con una tasa de error de palabra del 1,7 %, todos en la vanguardia.
El panorama de la IA de voz está cambiando
ElevenLabs ha sido durante mucho tiempo el punto de referencia en clonación de voz, pero Qwen3.5-Omni lo supera en estabilidad de voz multilingüe. Más importante aún, convierte la clonación de voz en una característica integrada de un modelo multimodal integral, en lugar de un producto vertical separado.
Por supuesto, la clonación de voz actualmente solo está disponible a través de API, aún no en la interfaz del producto, y probablemente se abrirá cuando la comercialización se ponga al día.
Los datos de entrenamiento de todo el modelo utilizan más de 100 millones de horas de contenido de audio y vídeo, una escala necesaria para respaldar una comprensión verdaderamente multimodal.
La función de Vibe Coding con audio y vídeo es una dirección interesante: antes, Vibe Coding requería describir necesidades en lenguaje natural; ahora, simplemente graba la pantalla con explicaciones, el modelo ve el vídeo y escribe el código. Si este camino es viable, será una forma muy diferente de interacción de programación.
Fuente de referencia: Qwen 3.5 Omni: Alibaba's AI Model Can Now Hear, Watch, and Clone Your Voice (Decrypt); Qwen3.5-Omni: 10-Hour Audio, 4M Frame Video, SOTA in 215 Benchmarks (StableLearn); CocoLoop, Alibaba Qwen Team Releases Qwen3.5 Omni (MarkTechPost)