El 11 de septiembre, Xiaomi liberó como código abierto un modelo de reconocimiento de voz llamado Xiaomi-CocktailASR-1, diseñado específicamente para resolver el "problema de la fiesta de cóctel": cuando toda una sala habla a la vez, el modelo transcribe únicamente a la persona que realmente se quiere escuchar. El código está en GitHub, bajo la organización xiaomi-research; los pesos están en Hugging Face; y el informe técnico se subió a arXiv el 10 de septiembre.
La entrada de este modelo incluye un elemento adicional respecto a un modelo de reconocimiento de voz habitual: un audio de referencia del interlocutor objetivo. El modelo usa ese audio como pista de huella vocal para aislar la voz de esa persona dentro de la pista superpuesta y transcribirla; lo que dicen los demás simplemente no aparece en el texto.
Las cifras
En cuanto a la tasa de error de caracteres en los conjuntos de prueba con múltiples hablantes, el informe da estas cifras: LibriMix con dos personas superpuestas, 4,11%; LibriMix3mix con tres personas superpuestas, 12,29%; LibriSpeechMix2mix, 2,90%. En ese mismo conjunto de pruebas con tres personas, los modelos de reconocimiento de voz habituales tuvieron una tasa de error de caracteres de entre el 76% y el 121%. Superar el 100% significa que se insertaron más caracteres erróneos que los que contenía el habla original: el modelo mezcló las intervenciones de dos o tres personas en una secuencia confusa.
Los datos de escenario real proceden de grabaciones de reuniones de AliMeeting; en condiciones de campo lejano, el TS-WER fue del 20,63%, casi siete puntos porcentuales por debajo del mejor resultado publicado anteriormente, 27,5%. En audio limpio de una sola persona, LibriSpeech alcanzó 1,73%, prácticamente a la par de los modelos generales dominantes; esta cifra es la que determina si el modelo puede usarse como un ASR de propósito general y no solo como una herramienta especializada para escenarios de voces superpuestas.
Hay otro indicador: el rechazo. Cuando el interlocutor objetivo simplemente no habla, el modelo debe devolver texto vacío. En el conjunto de muestras negativas en inglés, su tasa de rechazo correcto fue del 79,59%; el informe usa Gemini-2.5-pro como comparación, cuya tasa de rechazo falso es del 21,31%, es decir, cuando debería transcribir, concluye erróneamente que "no habla nadie".
Una estructura sencilla, pero un volumen de datos nada pequeño
Son tres partes: un codificador de audio autosupervisado basado en Data2Vec2, con unos 60 millones de parámetros, que genera embeddings de fotograma de 1280 dimensiones; un adaptador lineal que proyecta esos embeddings al espacio oculto del modelo de lenguaje; y un backbone Qwen3-8B. En conjunto, es una arquitectura de modelo de lenguaje de extremo a extremo, no la combinación tradicional de modelo acústico más modelo de lenguaje propia del ASR clásico.
El entrenamiento se divide en cuatro etapas; solo la segunda etapa consume más de 400.000 horas de datos con múltiples hablantes y 600.000 horas de datos con un solo hablante. Esta escala indica que la capacidad del modelo procede principalmente del volumen de datos y de la cobertura de la mezcla sintética de audio; la arquitectura en sí no supone una barrera alta para que terceros la repliquen.
El modelo también admite un modo de cadena de razonamiento (chain-of-thought): antes de transcribir, primero infiere "cuántas personas hay en este audio y a qué tramo corresponde la voz objetivo", y solo entonces transcribe. Según el informe, activar el CoT reduce la tasa de error de palabras otros 0,24 puntos porcentuales (valor absoluto). Desde el punto de vista de la ingeniería, esa ganancia de 0,24 puntos probablemente no compensa el coste extra de inferencia; el valor de este modo está más en la interpretabilidad: cuando hay un error, se puede ver en qué paso se equivocó el modelo.
Qué significa esto para su implantación en China
En el sector del reconocimiento de voz en China no faltan soluciones comerciales; lo que falta es un componente de código abierto capaz de fijarse de forma estable en una persona dentro de una conversación con varias voces. Actas de reuniones, habitáculos de coche con varios ocupantes, control de calidad de grabación doble en atención al cliente, audífonos: todos estos escenarios tropiezan con el mismo punto: el micrófono capta a más de una persona.
No es difícil adivinar hacia dónde apunta la propia Xiaomi: los asistentes de voz en coches y dispositivos IoT también tienen que lidiar con varias personas en el mismo espacio. Pero esta vez se han liberado los pesos completos junto con el código en formato abierto, de modo que terceros pueden usarlos directamente sin esperar a que algún servicio en la nube abra una API. Todos los conjuntos de prueba del informe son además conjuntos de datos públicos, lo que reduce la barrera para que otros repliquen los resultados y encuentren fallos.
Conviene añadir una salvedad: conjuntos de datos como LibriMix se construyen mezclando artificialmente voces limpias, lo que no coincide del todo con la reverberación, la dirección y las interrupciones de una sala real. La cifra más cercana al uso cotidiano es la de AliMeeting, 20,63%, todavía a cierta distancia de ser "realmente útil". Xiaomi tampoco ha publicado resultados específicos del modelo en escenarios de varias personas hablando en chino.
Fuentes: repositorio de código abierto de Xiaomi xiaomi-research/xiaomi-cocktailasr-1, CocoLoop, informe técnico en arXiv 2609.11274, IT Home; las cifras de tasa de error de caracteres y tasa de rechazo de cada conjunto de datos siguen el informe técnico.