StepFun lança cinco modelos de voz, taxa de erro de palavras cai para 1,7%

Em 15 de setembro, a StepFun lançou a série StepAudio 3, apresentando de uma só vez cinco modelos: StepAudio 3 Realtime, ASR, TTS, Gen e Music, todos disponíveis na plataforma aberta da StepFun.

Segundo o ranking do instituto independente de avaliação Artificial Analysis, o Realtime obteve pontuação geral de 98,9% no quesito Conversational Dynamics, ficando em primeiro lugar; no ranking Speech Reasoning da mesma instituição, sua precisão em raciocínio de voz foi de 99,7%, também em primeiro. O ASR registrou taxa de erro de palavras de 1,7% no ranking de precisão de reconhecimento de voz não streaming, empatado em primeiro.

Cinco modelos, cada um com sua função

A divisão de tarefas é, em linhas gerais, esta: o Realtime cuida de conversas em tempo real full-duplex, com o modelo raciocinando diretamente sobre o áudio, sem passar por transcrição textual; o ASR incorpora a compreensão semântica do modelo de grande porte à etapa de reconhecimento e, segundo a empresa, consegue lidar com dialetos, mistura de chinês e inglês e vocabulário técnico especializado; o TTS faz síntese em nível quase humano, reproduzindo, além da pronúncia correta, elementos paralinguísticos como pausas e entonação; o Gen reúne voz humana, efeitos sonoros, sons ambientes e música de fundo em uma única interface de geração; o Music permite composição interativa em múltiplas rodadas e pode controlar a melodia diretamente via notação ABC.

Dos cinco, o que exige mais sofisticação é o "raciocínio de voz nativo" do Realtime. O método tradicional converte voz em texto, raciocina sobre o texto e depois converte o texto de volta em voz — nessa cadeia de três etapas, tom, ênfase e emoção já se perdem logo na primeira. Só ao pular essa etapa de conversão o modelo tem chance de entender se "você fala muito bem" é elogio ou ironia.

O anúncio não menciona em nenhum momento se os modelos são de código aberto nem como será a cobrança.

Como interpretar o número 1,7%

A taxa de erro de palavras de 1,7% é um resultado em modo não streaming, e essa condição não pode ser omitida. Não streaming significa que o modelo recebe o áudio completo antes de transcrever, podendo considerar o contexto anterior e posterior; no modo streaming, é preciso gerar o texto enquanto ouve, vendo apenas o que já passou, e a taxa de erro costuma ser bem mais alta. Comparar os dois números de modalidades diferentes lado a lado não faz sentido.

"Empatado em primeiro" também é uma informação relevante. Mostra que essa posição não é exclusiva — pelo menos outro modelo parou na mesma casa decimal; no quesito de reconhecimento não streaming, a diferença entre os líderes já caiu para a casa dos milésimos.

A diferenciação real provavelmente está fora do ranking: quantos dialetos são cobertos, quão limpa é a troca em falas mistas, se termos técnicos exigem configuração extra. A StepFun menciona esses pontos, mas não apresenta números comparáveis.

O que isso significa para as equipes chinesas

Neste ano, a densidade de modelos de voz lançados publicamente na China não é baixa. A Tencent Hunyuan abriu o código do modelo AuK, a Xiaomi abriu o código de um modelo de reconhecimento multi-falante, e o modelo de voz da Tongyi, da Alibaba, ganhou suporte a chamadas de ferramentas. A diferença está na abordagem: as empresas que optam por código aberto disponibilizam os pesos para qualquer um ajustar; já os cinco modelos da StepFun ficam diretamente na própria plataforma aberta, acessados via API — uma barreira de entrada mais baixa para equipes que não pretendem montar seu próprio cluster de inferência, ao custo de rodar o modelo em máquina de terceiros.

Para equipes que desenvolvem produtos de voz, o que costuma decidir a adoção são três outras questões: a que ponto a latência ponta a ponta do Realtime pode chegar em milissegundos, se o timbre do TTS pode ser personalizado, e se os efeitos sonoros gerados pelo Gen têm licença para uso comercial. Nenhum desses três pontos foi detalhado no anúncio; será preciso esperar a documentação da plataforma aberta.

Fontes: anúncio oficial da StepFun, ranking da Artificial Analysis, CocoLoop, ITHome; os nomes dos cinco modelos, os critérios de pontuação de Conversational Dynamics e Speech Reasoning, e a taxa de erro de palavras não streaming seguem o anúncio oficial e as páginas de ranking.