오염된 페이지 한 장으로 AI가 가짜 제품 추천
새 벤치마크 FORGE에 따르면 검색 결과 페이지 한 장만 오염시켜도 AI가 가짜 제품을 최대 27% 확률로 추천한다.
벤치마크 관련 제품 동향과 산업 분석 4건을 모았습니다.
새 벤치마크 FORGE에 따르면 검색 결과 페이지 한 장만 오염시켜도 AI가 가짜 제품을 최대 27% 확률로 추천한다.
GeneBench-Pro는 정답형 문제가 아니라 지저분한 생물학 데이터로 연구 판단을 내릴 수 있는지를 묻는다.
Google DeepMind가 공개한 Gemini 3.1 Pro가 추적 중인 18개 주요 벤치마크 중 12개에서 1위를 차지했다. 특히 ARC-AGI-2에서 77.1%를 기록하며 추론 능력이 전작 대비 2배 이상 향상됐다. 100만 토큰 컨텍스트, MEDIUM 사고 수준 추가 등 실용적 기능을 갖췄지만, 종합 점수와 코딩 성능에서는 GPT-5.4 Pro와 Claude Opus 4.6에 미치지 못한다.
SWE-bench는 AI 코딩 능력의 사실상 표준 벤치마크가 되었지만, 점수를 올바르게 해석하려면 무엇을 테스트하고 무엇을 테스트하지 않는지 이해하는 것이 중요합니다.