Em 30 de março, a equipe Qwen da Alibaba lançou o Qwen3.5-Omni, seu primeiro modelo verdadeiramente multimodal — processando texto, imagens, áudio e vídeo em um único modelo, em vez de uma arquitetura composta por vários modelos especializados.
Um modelo, quatro modalidades
Os sistemas multimodais anteriores no mercado funcionavam principalmente com base na "divisão de trabalho": um modelo para visão, um para audição e, finalmente, um modelo de texto para consolidar as saídas. O Qwen3.5-Omni é diferente, utilizando uma arquitetura dupla Thinker-Talker com MoE de atenção mista (30B parâmetros totais, ativando 3B por vez), com todas as modalidades executadas no mesmo conjunto de parâmetros.
Isso permite que o modelo realize tarefas antes impossíveis:
- Compreensão conjunta de áudio e vídeo: Após assistir a um vídeo, o modelo pode responder com base tanto no conteúdo visual quanto na fala contida nele, sem precisar transcrever o áudio primeiro.
- Clonagem de voz em tempo real: Carregue uma amostra de voz e o modelo pode replicar esse timbre para saídas subsequentes (atualmente acessível via API).
- Vibe Coding com áudio e vídeo: Grave a tela com explicações em voz alta, e o Qwen3.5-Omni gera diretamente o código correspondente, sem necessidade de digitação.
Especificações técnicas
| Especificação | Valor |
|---|---|
| Parâmetros totais | 30B MoE |
| Parâmetros ativados por vez | 3B |
| Janela de contexto | 256K tokens |
| Duração máxima de áudio | 10+ horas |
| Processamento máximo de vídeo | 400 segundos 720p @1FPS |
| Idiomas de reconhecimento de fala | 113 |
| Idiomas de saída de fala | 36 |
Três versões: Plus (tarefas complexas de ponta), Flash (equilíbrio entre velocidade e desempenho), Light (leve e rápido).
Desempenho em benchmarks
O modelo alcançou SOTA em 215 conjuntos de dados de teste e benchmarks, com a parte de áudio superando diretamente o Gemini 3.1 Pro:
- MMAU compreensão abrangente de áudio: 82,2 contra 81,1 do Gemini 3.1 Pro
- Compreensão musical RUL-MuchoMusic: 72,4 contra 59,6, uma diferença significativa
- Estabilidade de clonagem de voz multilíngue: supera ElevenLabs, GPT-Audio e Minimax
A latência de conversação em tempo real foi reduzida para 234 milissegundos, utilizando a tecnologia ARIA (Adaptive Rate Interleave Alignment) para ajustar dinamicamente o ritmo da fala, tornando a saída mais natural em vez de uma leitura mecânica.
Além disso, as capacidades gerais não foram prejudicadas: MMMU compreensão visual 82,0%, HumanEval código 92,6%, LibriSpeech reconhecimento de fala com taxa de erro de palavra de 1,7%, todos na vanguarda.
O cenário da IA de voz está mudando
A ElevenLabs tem sido há muito tempo a referência em clonagem de voz, mas o Qwen3.5-Omni a superou em estabilidade de voz multilíngue. Mais importante, ele transforma a clonagem de voz em um recurso integrado de um modelo multimodal abrangente, em vez de um produto vertical separado.
Naturalmente, a clonagem de voz está atualmente disponível apenas via API, ainda não na interface do produto, e provavelmente será aberta quando a comercialização acompanhar.
Os dados de treinamento de todo o modelo usam mais de 100 milhões de horas de conteúdo de áudio e vídeo, uma escala necessária para suportar uma compreensão verdadeiramente multimodal.
O recurso de Vibe Coding com áudio e vídeo é uma direção interessante — antes, o Vibe Coding exigia a descrição de necessidades em linguagem natural; agora, basta gravar a tela com explicações, e o modelo assiste ao vídeo e escreve o código. Se esse caminho for viável, será uma forma muito diferente de interação de programação.
Fonte de referência: Qwen 3.5 Omni: Alibaba's AI Model Can Now Hear, Watch, and Clone Your Voice (Decrypt); Qwen3.5-Omni: 10-Hour Audio, 4M Frame Video, SOTA in 215 Benchmarks (StableLearn); CocoLoop, Alibaba Qwen Team Releases Qwen3.5 Omni (MarkTechPost)