汚染ページ1枚でAIが偽物を27%推薦
検索結果のページ1枚を汚染するだけで、AIが偽の製品を最大27%の確率で推薦すると新ベンチマークFORGEが指摘した。
ベンチマークに関する製品動向と業界分析を全4件掲載しています。
検索結果のページ1枚を汚染するだけで、AIが偽の製品を最大27%の確率で推薦すると新ベンチマークFORGEが指摘した。
GeneBench-Proは、整理済みの設問ではなく、ノイズを含む生物データから研究判断を下せるかを測る。
Google DeepMindが公開したGemini 3.1 Proは、追跡中の18の主要ベンチマークのうち12で首位を獲得。特にARC-AGI-2で77.1%を記録し、推論能力が前世代比2倍以上に向上。100万トークンのコンテキスト対応やMEDIUM思考レベルの追加など実用的な機能も備えるが、総合スコアやコーディング性能ではGPT-5.4 ProやClaude Opus 4.6に及ばない。
SWE-benchはAIコーディング能力の事実上の標準ベンチマークとなっているが、そのスコアを正しく解釈するには、何をテストし、何をテストしていないかを理解することが重要である。