Satu Halaman Beracun Bikin AI Rekomendasikan Produk Palsu 27%
Benchmark baru FORGE menemukan bahwa meracuni satu halaman hasil pencarian saja bisa membuat AI merekomendasikan produk palsu hingga 27% dari waktu.
4 artikel terverifikasi tentang Benchmark, produk, dan perkembangan industri.
Benchmark baru FORGE menemukan bahwa meracuni satu halaman hasil pencarian saja bisa membuat AI merekomendasikan produk palsu hingga 27% dari waktu.
GeneBench-Pro memakai data biologi yang kotor untuk menguji keputusan riset model, bukan sekadar hafalan soal.
Google DeepMind merilis Gemini 3.1 Pro yang unggul di 12 dari 18 tolok ukur utama yang dilacak, dengan skor 77,1% di ARC-AGI-2. Model ini menggandakan kemampuan penalaran dibanding pendahulunya, menambahkan level berpikir MEDIUM, dan mendukung konteks 1 juta token, namun masih tertinggal dari GPT-5.4 Pro dan Claude Opus 4.6 dalam skor komposit dan tugas pengkodean.
SWE-bench telah menjadi tolok ukur standar untuk kemampuan coding AI, tetapi memahami apa yang diuji—dan apa yang tidak—sangat penting untuk menafsirkan skor dengan benar.