Qwen recorta precios de toda su línea de voz, el reconocimiento baja hasta un 95%

El 23 de septiembre, Qwen, de Alibaba, presentó la serie de modelos de voz Qwen-Audio-3.1, con el lanzamiento simultáneo de cinco modelos que cubren reconocimiento, síntesis, diálogo en tiempo real y creación de audio, y a la vez rebajó los precios de toda su línea de productos de voz: la síntesis de voz (TTS) baja cerca de un 70%, la voz en tiempo real (Realtime) cerca de un 85% y el reconocimiento de voz (ASR) hasta un 95%.

Los cinco modelos se dividen en dos grupos. Tres son actualizaciones de líneas ya existentes:

  • Qwen-Audio-3.1-ASR: un solo modelo admite 30 idiomas y 16 dialectos chinos; según la empresa, logra los mejores resultados en 11 subconjuntos de prueba de dialectos, con mejoras notables en dialectos difíciles como el de Wenzhou, y un tiempo de respuesta del primer carácter de unos 160 milisegundos;
  • Qwen-Audio-3.1-TTS: síntesis multilingüe con transferencia de timbre entre idiomas, que permite especificar el tono en lenguaje natural, como pedir que "lea con un tono firme e inflexible";
  • Qwen-Audio-3.1-Realtime: diálogo full-duplex, habla y escucha simultáneas, se puede interrumpir en cualquier momento y admite llamadas a herramientas; según la empresa, el modelo reduce el ritmo del habla cuando detecta que el ánimo del usuario decae.

Los otros dos son modelos completamente nuevos:

  • TTS-Next: un marco unificado que combina un modelo de lenguaje y un modelo de difusión, capaz de generar voz, efectos de sonido y música de fondo en una sola pasada, pensado para audiolibros, pódcast, videojuegos y publicidad;
  • ASR-Next: puede distinguir entre hablantes cuando hay varias personas hablando, aportando marcas de tiempo y texto alineado, además de reconocer emociones, sonidos del entorno y sonidos de maquinaria, útil para descripción de audio, localización de eventos y preguntas y respuestas sobre audio.

Resultados por dialecto

En el material de presentación, Qwen ofreció varios datos sobre dialectos: la tasa media de error de caracteres en el reconocimiento de dialectos chinos es del 10,38%, y la precisión semántica media por frase en la traducción dialectal es del 82,10%. Son cifras de pruebas internas de la propia empresa, la composición del conjunto de prueba no se ha divulgado por completo y todavía no existe una reproducción independiente por terceros.

Para los desarrolladores en China, el reconocimiento de dialectos es una necesidad real. En atención al cliente, líneas directas de administraciones públicas y transmisiones en vivo de comercio electrónico en zonas rurales, el reconocimiento del mandarín estándar suele ser preciso, pero falla en cuanto aparece un dialecto, un punto que frena la adopción práctica de muchos productos de voz. Reunir 16 dialectos en un solo modelo ya evita, al menos, tener que cambiar de modelo según la región.

Frente a ElevenLabs

En el terreno de la síntesis de voz, el punto de comparación habitual fuera de China es ElevenLabs. El servicio externo de enrutamiento OrcaRouter recopiló un conjunto de precios: la generación anterior, Qwen-Audio-3.0, costaba cerca de 27,6 dólares por millón de caracteres en el nivel TTS Plus y unos 15 dólares en el nivel Flash; ElevenLabs Eleven v3 cuesta cerca de 100 dólares por millón de caracteres en su precio estándar y unos 50 dólares en el nivel Flash.

Calculando a grandes rasgos con el recorte de "cerca de un 70%", el nivel Plus de la versión 3.1 quedaría en poco más de 8 dólares por millón de caracteres. Es solo una estimación: el propio anuncio únicamente indica el porcentaje de rebaja, y los precios nuevos concretos dependerán de la lista de precios de Alibaba Cloud Bailian.

En cuanto a calidad, según los datos de agosto de la arena de voz de Artificial Analysis, Qwen-Audio-3.0-TTS-Plus obtuvo una puntuación Elo de 1234, frente a 1168 de Eleven v3. La versión 3.1 del TTS todavía no figura en ninguna arena pública, así que si la calidad de audio de la nueva versión mejora o empeora, por ahora solo lo dice el propio fabricante.

Dónde se usa

En esta ocasión, Qwen vincula sus modelos de voz a una serie de productos propios: el agente de programación Qoder, Qwen Office, además de dispositivos como QwenNote, A2, Eva, las gafas de IA Qwen y las gafas de IA Leqi. Dispositivos como gafas o grabadoras de voz llaman a las API de voz por minuto o por uso, así que la rebaja de entre el 85% y el 95% en reconocimiento y diálogo en tiempo real afecta de forma más directa al coste de servicio por dispositivo de los fabricantes de hardware.

El recorte del diálogo en tiempo real es el segundo mayor. Una llamada en tiempo real suele tener que ejecutar a la vez reconocimiento, inferencia y síntesis, lo que la sitúa entre los productos de voz con un coste unitario más alto; que los asistentes de voz puedan mantenerse gratuitos para los usuarios a largo plazo tras este recorte dependerá de la política de precios que adopte cada integrador el próximo trimestre.

Fuentes: anuncio oficial de Qwen, ITHome, The Decoder, CocoLoop, recopilación de precios de OrcaRouter; los porcentajes de rebaja y los datos de pruebas de dialectos son cifras oficiales de Qwen, los precios de la versión anterior y de ElevenLabs son recopilaciones de terceros, y las puntuaciones de la arena siguen la clasificación pública de Artificial Analysis.