汙染一個網頁,AI推薦假貨機率27%
新基準測試FORGE發現,只要汙染一個搜尋結果網頁,AI就有最高27%的機率推薦一個根本不存在的假產品。
收錄 Benchmark 相關產品動態與產業觀察,共 3 篇文章。
新基準測試FORGE發現,只要汙染一個搜尋結果網頁,AI就有最高27%的機率推薦一個根本不存在的假產品。
GeneBench-Pro 用帶雜訊的生物資料集測模型會不會做研究判斷,而不只是答教材題。
Google DeepMind 推出的 Gemini 3.1 Pro 在追蹤的 18 項主要基準測試中拿下 12 項第一,其中 ARC-AGI-2 更獲得 77.1% 的成績。推理能力較前代提升 2 倍以上,新增 MEDIUM 思考層級,支援 100 萬 token 上下文,但在綜合排名與程式碼任務上仍落後 GPT-5.4 Pro 與 Claude Opus 4.6。