StepFunが音声5モデル発表、誤り率1.7%に
StepFunが音声AIモデル「StepAudio 3」を5種同時発表。RealtimeなどがArtificial Analysisの複数部門で首位となり、ASRの誤り率は1.7%を記録した。
音声認識に関する製品動向と業界分析を全4件掲載しています。
StepFunが音声AIモデル「StepAudio 3」を5種同時発表。RealtimeなどがArtificial Analysisの複数部門で首位となり、ASRの誤り率は1.7%を記録した。
小米が公開した音声認識モデルは、3人同時発話でも目的の話者だけを聞き分けて書き起こす。誤り率12.29%は競合の76〜121%を大きく下回る。
Hume AIの検証実験で、公開ベンチマークのスコア上位モデルほど、実際の音声ではなくデータセットの参照テキストの誤りをそのまま再現している傾向が判明した。
TencentはHy ASR 3.0 previewを公開し、WER、方言対応、クラウドAPIの制限を示した。