存在しない数字を読み上げる音声認識モデル
Hume AIの検証実験で、公開ベンチマークのスコア上位モデルほど、実際の音声ではなくデータセットの参照テキストの誤りをそのまま再現している傾向が判明した。
大規模モデル評価に関する製品動向と業界分析を全4件掲載しています。
Hume AIの検証実験で、公開ベンチマークのスコア上位モデルほど、実際の音声ではなくデータセットの参照テキストの誤りをそのまま再現している傾向が判明した。
Alibaba、HSコード分類でAgentの限界を測るを、日本のテクノロジー読者向けに要点、数字、検証すべき論点を保った形で整理した記事です。
750問のベンチマークは、主要モデルが生命科学を助けられても独立研究にはまだ遠いことを示した。
上海交通大学などの基準は、エージェントが正しいファイルを見つけても、バグに関係する行の命中率は14〜19%にとどまると示した。