Tencent lleva ASR hacia el contexto

Tencent Hunyuan lanzó Hy ASR 3.0 preview el 4 de agosto. QbitAI informa que el modelo se basa en Hy3 y combina reconocimiento de voz con comprensión semántica. La documentación de Tencent Cloud confirma que se usa mediante la API WebSocket de reconocimiento en tiempo real, con engine_model_type igual a Hy-ASR-3.0-preview.

Las primeras cifras son WER

QbitAI e ITHome citan los mismos datos de benchmarks abiertos: WER de 3,34% en mandarín, 2,62% en inglés y 3,12% en cantonés. Tencent Cloud también lista 20 canales simultáneos gratuitos y soporte para mandarín, inglés y 20 dialectos chinos.

No son métricas equivalentes. WER mide salida del modelo. La concurrencia gratuita y los dialectos describen el límite del producto cloud. Para desarrolladores, API, cuota y cobertura regional pesan tanto como la precisión.

La clave es el contexto

Tencent dice que Hy ASR pasa de "逐字转写、单点优化" a "理解语境、兼容场景、一键直出". En producto, eso significa usar las frases anteriores y posteriores para resolver homófonos, términos técnicos y nombres de proyecto.

QbitAI reporta que la receta SFT cubre context, términos profesionales, entornos acústicos y hablantes diversos. Los datos dialectales cubren 10 grandes regiones y más de 20 subregiones. Tencent también menciona reinforcement learning por etapas para transcripción general, Any-context y escenarios acústicos de cola larga.

La preview sigue limitada

Tencent Cloud aclara que la preview solo admite ASR en tiempo real, audio de menos de un minuto y entrada PCM mono 16k. Separación de hablantes, VAD, reemplazo de vocabulario y umbrales de ruido aún no están disponibles. Context input y hot words llegarán después.

El encaje inicial está en voz corta, subtítulos en vivo, atención al cliente, búsqueda por voz y comandos de asistente. Reuniones largas y entrevistas con varios hablantes aún necesitan un producto más maduro.

Fuentes: QbitAI, ITHome, Tencent Cloud documentation, CocoLoop, CLS; verified release timing, WER figures, 20 free concurrent channels, 20 dialects, preview input limits, API parameter and Yuanbao rollout.