音檔裡沒有的數字,語音模型照樣念出來
Hume AI 對 11 款主流語音辨識模型的診斷實驗發現,公開榜單分數愈高的模型,愈可能是在複誦資料集本身寫錯的參考文字,而非真的聽得更準。
收錄 大模型評測 相關產品動態與產業觀察,共 4 篇文章。
Hume AI 對 11 款主流語音辨識模型的診斷實驗發現,公開榜單分數愈高的模型,愈可能是在複誦資料集本身寫錯的參考文字,而非真的聽得更準。
阿里用海關編碼測出 Agent 短板以繁體中文科技新聞語氣重寫,保留關鍵數字、產品邊界與後續觀察點。
750 題基準測試顯示,前沿模型已能輔助生命科學,但距離獨立承擔研究仍很遠。
上海交通大學牽頭的新基準指出,agent 常能找到正確文件,但真正與 bug 相關的行命中率只有約 14% 到 19%。