投毒一个网页,大模型 27% 推荐假货
编辑精选 FORGE 只改检索结果里的一个页面,12 个模型全部中招。开了推理的那些被骗得更狠——它会自己编出"很多人在用"这类社会证据,替一个不存在的产品圆场。 搜索增强的大模型正在接管一件很日常的事:帮人挑东西买。你问"两千块以内的降噪
收录 benchmark 相关 AI 新闻、产品动态和产业观察。 本页收录 3 篇已发布文章。
编辑精选 FORGE 只改检索结果里的一个页面,12 个模型全部中招。开了推理的那些被骗得更狠——它会自己编出"很多人在用"这类社会证据,替一个不存在的产品圆场。 搜索增强的大模型正在接管一件很日常的事:帮人挑东西买。你问"两千块以内的降噪
OpenAI 6 月 30 日放出一套新测试,叫 GeneBench Pro,专门考 AI 能不能顶替计算生物学家干活。第一批成绩出来,最能打的是它自家的 GPT 5.6 Sol Pro——129 道题,过了 31.5%。 这套题刁钻在数据
二月底,Google DeepMind发布了Gemini 3.1 Pro。发布后有一个数字在开发者社区传得比较广: 在目前追踪的18个主要benchmark里,3.1 Pro拿了12个第一 。 更值得关注的是ARC AGI 2——这个测试专