Google, 추론 능력 강조한 Gemini 2.5 Pro 출시

지난해 3월 말, Google은 "지금까지 가장 지능적인 모델"이라고 공식 발표하며 Gemini 2.5 Pro를 공개했습니다.

이런 주장은 모든 회사가 하지만, 이번 Gemini 2.5 Pro의 벤치마크 점수는 확실히 인상적입니다.

수학 및 과학 추론

  • AIME 2024: 92.0%
  • AIME 2025: 86.7%
  • Humanity's Last Exam: 18.8%(도구를 사용하지 않은 모델 중 최고)

마지막 테스트는 수백 명의 분야 전문가들이 "인간 지식의 경계"를 시험하기 위해 만든 문제로, 거의 20%에 달하는 정답률을 기록한 것은 상당히 놀라운 일입니다.

코드 및 멀티모달

  • LiveCodeBench: 경쟁 수준 프로그래밍 1위
  • MMMU: 84.0%(멀티모달 추론)
  • WebDevArena Elo: 1443(리더보드 1위)

컨텍스트 능력

기본적으로 100만 토큰 컨텍스트 창(최대 200만까지 확장 가능)을 제공하며, 텍스트, 오디오, 이미지, 비디오 등 멀티모달 입력을 지원합니다. 전체 코드 저장소를 그대로 입력하여 이해시킬 수 있으며, 분할할 필요가 없습니다.

Gemini 2.5 Pro는 'Thinking Model'입니다. 응답하기 전에 내부적으로 추론을 수행합니다. 이 설계 방식은 OpenAI의 o 시리즈 및 DeepSeek R1과 같은 맥락이지만, Google의 구현은 멀티모달 시나리오에서 더 균형 잡힌 성능을 보여줍니다.

하지만 실제 사용에서 응답 속도 문제가 반복적으로 제기되고 있습니다. 심층 추론은 더 긴 대기 시간을 의미하며, 빠른 상호작용이 필요한 상황에서는 경험이 저하됩니다. 이는 모든 Thinking Model이 공통적으로 안고 있는 트레이드오프입니다.

LMArena에서 Elo 점수는 1470으로, 출시 전보다 24포인트 상승하며 리더보드 선두를 유지하고 있습니다. Google은 AI 분야에서 오랫동안 비판을 받아왔지만, 이번에는 제품력으로 응답한 셈입니다.

출처: CocoLoop, VentureBeat 보도, Google 공식 발표