Qwen corta preços de toda a linha de voz, reconhecimento cai até 95%

Em 23 de setembro, a Qwen, da Alibaba, lançou a série de modelos de voz Qwen-Audio-3.1, apresentando de uma só vez cinco modelos que cobrem reconhecimento, síntese, diálogo em tempo real e criação de áudio, além de reduzir os preços de toda a linha de produtos de voz: síntese de voz (TTS) cai cerca de 70%, voz em tempo real (Realtime) cai cerca de 85% e reconhecimento de voz (ASR) cai até 95%.

Os cinco modelos se dividem em duas categorias. Três são atualizações de linhas já existentes:

  • Qwen-Audio-3.1-ASR: um único modelo suporta 30 idiomas e 16 dialetos chineses; segundo a empresa, obtém os melhores resultados em 11 subconjuntos de teste de dialetos, com ganhos notáveis em dialetos difíceis como o de Wenzhou, e tempo de resposta do primeiro caractere de cerca de 160 milissegundos;
  • Qwen-Audio-3.1-TTS: síntese multilíngue com transferência de timbre entre idiomas, permitindo especificar o tom de voz em linguagem natural, como pedir para "ler em um tom firme e inflexível";
  • Qwen-Audio-3.1-Realtime: diálogo full-duplex, fala e escuta simultâneas, pode ser interrompido a qualquer momento e suporta chamadas de ferramentas; segundo a empresa, o modelo reduz o ritmo da fala ao perceber que o usuário está com o humor baixo.

Dois são modelos totalmente novos:

  • TTS-Next: um framework unificado que combina modelo de linguagem e modelo de difusão, gerando voz, efeitos sonoros e música de fundo em uma única passagem, voltado para audiolivros, podcasts, jogos e publicidade;
  • ASR-Next: consegue distinguir falantes em conversas com múltiplas pessoas, fornecendo marcações de tempo e texto alinhado, além de reconhecer emoções, sons do ambiente e sons de máquinas, útil para descrição de áudio, localização de eventos e perguntas e respostas sobre áudio.

Boletim de dialetos

No material de lançamento, a Qwen apresentou alguns números sobre dialetos: a taxa média de erro de caracteres no reconhecimento de dialetos chineses é de 10,38%, e a precisão semântica média de frases na tradução de dialetos é de 82,10%. São números de testes internos da própria empresa, a composição do conjunto de teste não foi totalmente divulgada e ainda não há reprodução independente por terceiros.

Para desenvolvedores na China, o reconhecimento de dialetos é uma necessidade concreta. Em atendimento ao cliente, linhas diretas de serviços públicos e transmissões ao vivo de e-commerce em cidades do interior, o reconhecimento do mandarim padrão costuma ser preciso, mas falha assim que aparece um dialeto — um dos pontos que travam a adoção prática de muitos produtos de voz. Reunir 16 dialetos em um único modelo já elimina, pelo menos, a necessidade de trocar de modelo conforme a região.

Comparação com o ElevenLabs

Na frente de síntese de voz, o ponto de comparação internacional costuma ser o ElevenLabs. O serviço terceirizado de roteamento OrcaRouter compilou um conjunto de preços: a geração anterior, Qwen-Audio-3.0, custava cerca de US$ 27,6 por milhão de caracteres no nível TTS Plus e cerca de US$ 15 no nível Flash; o ElevenLabs Eleven v3 custa cerca de US$ 100 por milhão de caracteres no preço padrão e cerca de US$ 50 no nível Flash.

Fazendo uma conta aproximada com o corte de "cerca de 70%", o nível Plus da versão 3.1 cairia para pouco mais de US$ 8 por milhão de caracteres. Trata-se apenas de uma estimativa — o próprio anúncio informa apenas o percentual de desconto, e os novos preços exatos seguem a tabela de preços do Alibaba Cloud Bailian.

Em termos de qualidade, nos dados de agosto da arena de voz da Artificial Analysis, o Qwen-Audio-3.0-TTS-Plus obteve pontuação Elo de 1234, contra 1168 do Eleven v3. A versão 3.1 do TTS ainda não entrou em nenhuma arena pública, então se a qualidade sonora da nova versão avançou ou recuou, por ora, só se sabe pela palavra do próprio fabricante.

Onde é usado

Desta vez, a Qwen atrelou os modelos de voz a uma série de produtos próprios: o agente de programação Qoder, o Qwen Office, além de dispositivos de hardware como QwenNote, A2, Eva, os óculos de IA Qwen e os óculos de IA Leqi. Dispositivos como óculos e gravadores de voz chamam as APIs de voz por minuto ou por uso, então a redução de 85% a 95% no reconhecimento e no diálogo em tempo real afeta mais diretamente o custo de serviço por dispositivo dos fabricantes de hardware.

O corte no diálogo em tempo real é o segundo maior. Uma chamada em tempo real normalmente precisa rodar reconhecimento, inferência e síntese ao mesmo tempo, sendo uma das categorias de custo unitário mais alto entre os produtos de voz; se os assistentes de voz poderão permanecer gratuitos para usuários no longo prazo após esse corte de preços vai depender da política de preços que cada integrador adotar no próximo trimestre.

Fontes: anúncio oficial da Qwen, ITHome, The Decoder, CocoLoop, levantamento de preços da OrcaRouter; os percentuais de desconto e os dados de teste de dialetos seguem os números oficiais da Qwen, os preços da versão anterior e do ElevenLabs são compilações de terceiros, e as pontuações de arena seguem o ranking público da Artificial Analysis.