El 15 de septiembre, StepFun presentó la serie StepAudio 3, lanzando de golpe cinco modelos: StepAudio 3 Realtime, ASR, TTS, Gen y Music, todos disponibles ya en la plataforma abierta de StepFun.
Según el ranking de la firma independiente de evaluación Artificial Analysis, Realtime obtuvo una puntuación global del 98,9% en el apartado Conversational Dynamics, ocupando el primer puesto; en el ranking Speech Reasoning de la misma firma, su precisión en razonamiento de voz fue del 99,7%, también en primer lugar. ASR registró una tasa de error de palabras del 1,7% en el ranking de precisión de reconocimiento de voz no streaming, empatado en el primer puesto.
Cinco modelos, cada uno con su función
La división de tareas es, a grandes rasgos, la siguiente: Realtime se encarga de las conversaciones en tiempo real full-duplex, razonando directamente sobre el audio sin pasar por una transcripción de texto; ASR incorpora la comprensión semántica del modelo grande a la etapa de reconocimiento y, según la empresa, puede manejar dialectos, mezcla de chino e inglés y vocabulario técnico especializado; TTS realiza una síntesis casi humana que, además de pronunciar correctamente, reproduce elementos paralingüísticos como pausas y entonación; Gen integra voz humana, efectos de sonido, sonido ambiental y música de fondo en una sola interfaz de generación; Music admite composición interactiva en múltiples turnos y permite controlar la melodía directamente mediante notación ABC.
De los cinco, el que exige más sofisticación es el "razonamiento de voz nativo" de Realtime. El método tradicional convierte la voz en texto, razona sobre el texto y luego lo vuelve a convertir en voz; en esa cadena de tres pasos, el tono, el énfasis y la emoción ya se pierden en el primero. Solo al saltarse ese paso de conversión el modelo tiene la oportunidad de entender si "qué bien lo dices" es un elogio o una pulla.
El anuncio no menciona en ningún momento si los modelos son de código abierto ni cómo se cobrará por su uso.
Cómo leer ese 1,7%
La tasa de error de palabras del 1,7% corresponde al modo no streaming, y esa condición no se puede omitir. No streaming significa que el modelo recibe el audio completo antes de transcribirlo, pudiendo tener en cuenta el contexto anterior y posterior; el modo streaming exige generar texto mientras escucha, viendo solo lo que ya ha pasado, por lo que la tasa de error suele ser bastante más alta. Poner ambas cifras, de categorías distintas, una junto a otra no tiene sentido.
"Empatado en primer puesto" también es información en sí misma. Indica que esa posición no es exclusiva: al menos otro modelo se detiene en el mismo decimal; en el reconocimiento no streaming, la diferencia entre los líderes ya ha bajado a la milésima.
La verdadera diferenciación probablemente esté fuera del ranking: cuántos dialectos se cubren, qué tan limpio es el cambio en el habla mixta, si los términos técnicos requieren configuración adicional. StepFun menciona estos puntos, pero no ofrece cifras comparables.
Qué significa esto para los equipos chinos
Este año, la densidad de modelos de voz presentados públicamente en China no es baja. Tencent Hunyuan liberó el código del modelo AuK, Xiaomi liberó el de un modelo de reconocimiento multihablante, y el modelo de voz de Tongyi, de Alibaba, incorporó llamadas a herramientas. La diferencia está en el enfoque: quienes optan por el código abierto publican los pesos para que cualquiera pueda modificarlos; StepFun, en cambio, coloca sus cinco nuevos modelos directamente en su propia plataforma abierta, accesibles vía API, lo que reduce la barrera de entrada para equipos que no piensan montar su propio clúster de inferencia, a cambio de que el modelo corra en máquinas ajenas.
Para los equipos que desarrollan productos de voz, lo que suele decidir la integración son otras tres cuestiones: a cuántos milisegundos se puede reducir la latencia extremo a extremo de Realtime, si el timbre de TTS se puede personalizar y si los efectos de sonido generados por Gen cuentan con licencia comercial. El anuncio no aclara ninguno de estos tres puntos; habrá que esperar a la documentación de la plataforma abierta.
Fuentes: anuncio oficial de StepFun, ranking de Artificial Analysis, CocoLoop, ITHome; los nombres de los cinco modelos, los criterios de puntuación de Conversational Dynamics y Speech Reasoning, y la tasa de error de palabras no streaming siguen el anuncio oficial y las páginas de ranking.