News - Cocoloop
홈ClaudeOpenAIGeminiDeepSeek오픈소스전체 태그아카이브
文/A 한국어 ▾
简体中文 Simplified Chinese English English 日本語 Japanese 한국어 Korean 繁體中文 Traditional Chinese Bahasa Indonesia Indonesian Tiếng Việt Vietnamese Deutsch German Português Portuguese Español Spanish Français French

벤치마크 뉴스와 분석

벤치마크 관련 제품 동향과 산업 분석 4건을 모았습니다.

AI 검색 2026-08-25

오염된 페이지 한 장으로 AI가 가짜 제품 추천

새 벤치마크 FORGE에 따르면 검색 결과 페이지 한 장만 오염시켜도 AI가 가짜 제품을 최대 27% 확률로 추천한다.

#AI 안전#벤치마크#arXiv
OpenAI 2026-07-02

OpenAI 생물학 벤치마크, GPT-5.6도 31.5%에 그쳐

GeneBench-Pro는 정답형 문제가 아니라 지저분한 생물학 데이터로 연구 판단을 내릴 수 있는지를 묻는다.

#AI 신약 개발#벤치마크
Google 2026-04-13

Gemini 3.1 Pro, 18개 벤치마크 중 12개 1위

Google DeepMind가 공개한 Gemini 3.1 Pro가 추적 중인 18개 주요 벤치마크 중 12개에서 1위를 차지했다. 특히 ARC-AGI-2에서 77.1%를 기록하며 추론 능력이 전작 대비 2배 이상 향상됐다. 100만 토큰 컨텍스트, MEDIUM 사고 수준 추가 등 실용적 기능을 갖췄지만, 종합 점수와 코딩 성능에서는 GPT-5.4 Pro와 Claude Opus 4.6에 미치지 못한다.

#Gemini#추론#벤치마크
SWE-bench 2026-04-07

SWE-bench가 실제로 측정하는 것

SWE-bench는 AI 코딩 능력의 사실상 표준 벤치마크가 되었지만, 점수를 올바르게 해석하려면 무엇을 테스트하고 무엇을 테스트하지 않는지 이해하는 것이 중요합니다.

#AI 코딩#벤치마크

News · Cocoloop

프런티어 AI 모델, 오픈소스 커뮤니티, 산업 동향을 다루는 뉴스와 분석입니다. Cocoloop 편집팀이 공개 자료를 확인해 정리합니다.

모델 뉴스

  • Claude
  • OpenAI
  • Gemini
  • DeepSeek
  • Qwen

주제

  • 오픈소스
  • AI 코딩
  • Agent
  • 전체 태그

사이트

  • 홈
  • 기사 아카이브
  • RSS 구독
  • robots.txt
  • 편집 기준

링크

  • Cocoloop 메인
  • Q&A 사이트
  • Hermes 가이드
  • PixPix AI 이미지
  • AI 이미지 커뮤니티
文/A 한국어 ▾
简体中文 Simplified Chinese English English 日本語 Japanese 한국어 Korean 繁體中文 Traditional Chinese Bahasa Indonesia Indonesian Tiếng Việt Vietnamese Deutsch German Português Portuguese Español Spanish Français French

© 2026 News · Cocoloop — 프런티어 AI 뉴스

Sitemap