音频里没有的数字,语音模型照样念出来
编辑精选 把 LibriSpeech 音频里的数字消音,多个高分模型仍有三到四成概率照念不误。它们学到的是数据集的书写习惯,拿 WER 排名去挑生产环境的语音方案,选中的可能恰好是最会应付考题的那一个。 Hume AI 的七名研究员贴出一组
收录 大模型评测 相关 AI 新闻、产品动态和产业观察。 本页收录 4 篇已发布文章。
编辑精选 把 LibriSpeech 音频里的数字消音,多个高分模型仍有三到四成概率照念不误。它们学到的是数据集的书写习惯,拿 WER 排名去挑生产环境的语音方案,选中的可能恰好是最会应付考题的那一个。 Hume AI 的七名研究员贴出一组
AI Agent 又多了一道更接近真实工作的考题:不是让模型在网页里找答案,也不是让它把一段代码补完,而是给它一件商品,让它按海关规则判出 10 位 HS 编码。 阿里国际数字商业团队的 HSCodeComp 研究,7 月进入 ACL 20
先说结论:拿真正的生物科研题去考 AI,目前最猛的模型,三道里答对一道——这还是最高分。 这套题难在哪 OpenAI 6 月 17 日放出一套新基准,叫 LifeSciBench。专门干一件事:测 AI 到底会不会做生命科学的研究。 不是那
你让 Claude Code 去修个 bug,它八成能找对是哪个文件出的毛病。可真正要动的那几行,它经常看漏。 这不是拍脑袋。6 月 14 日,上海交通大学牵头的一个国际团队甩出一个新基准,专门测 AI 编程 agent 的"找代码"这一步