2월 말, Google DeepMind가 Gemini 3.1 Pro를 출시했다. 출시 이후 개발자 커뮤니티에서 한 숫자가 널리 공유됐다. 현재 추적 중인 18개 주요 벤치마크 중 3.1 Pro가 12개에서 1위를 차지했다.
더 주목할 만한 것은 ARC-AGI-2다. 이 테스트는 모델이 "한 번도 본 적 없는 새로운 논리 문제"를 해결하는 능력을 평가하기 위해 특별히 설계됐으며, 훈련 데이터를 암기해 통과하는 것을 방지한다. 3.1 Pro는 이 벤치마크에서 77.1%를 기록했다.
추론 능력 2배 향상의 의미
Google은 공식적으로 3.1 Pro의 추론 능력이 Gemini 3 Pro보다 2배 이상 향상됐다고 밝혔다.
이 말은 모호하게 들리지만, ARC-AGI-2 결과와 함께 보면 설득력이 있다. ARC-AGI는 매번 완전히 새로운 문제를 출제하며, 모델이 몇 가지 예시에서 패턴을 추론해 적용하도록 요구한다. 답을 암기해서는 통과할 수 없고, 진정한 추론만이 가능하다.
2배 향상은 대략 다음을 의미한다. 복잡한 다단계 문제가 주어졌을 때, 모델이 프롬프트에서 단계별로 안내받지 않고 스스로 문제를 분해하고 추론하며 검증할 수 있다. 새로운 MEDIUM 수준 Thinking Level이 추가됐으며(기존에는 켜기/끄기 두 단계만 있음), 이제 추론 깊이를 제어할 수 있다. 모든 작업에 가장 깊은 추론이 필요한 것은 아니므로 필요에 따라 조정할 수 있다.
기술 사양
컨텍스트 및 출력:
- 컨텍스트 윈도우: 100만 토큰
- 최대 출력: 65K 토큰
지원 입력 형식:
- 텍스트 및 코드
- 이미지(요청당 최대 3,000장, 각 7MB 이하)
- 오디오(최대 8.4시간)
- 비디오(오디오 포함 약 45분, 오디오 없음 약 1시간)
- PDF(요청당 최대 3,000페이지, 파일당 최대 50MB)
100만 토큰으로 무엇을 담을 수 있을까? 대규모 코드 저장소 전체, 또는 900페이지 분량의 PDF, 또는 8.4시간 분량의 팟캐스트 오디오에 해당한다. 전체 프로젝트를 넣고 직접 질문하는 것이 이제 실제로 가능해졌다.
실용적 기능
추론 능력 외에도 3.1 Pro에는 몇 가지 실용적인 기능이 추가됐다.
- Grounding with Google Search: 응답 시 실시간 검색을 수행해 지식 마감일로 인한 문제를 줄임
- 코드 실행: 모델이 코드를 실행해 결과를 검증할 수 있음. 코드 생성뿐 아니라 실행도 수행
- Finance 및 Spreadsheet 최적화: 이 두 가지 에이전트 시나리오에 맞게 특별히 조정됨
- RAG Engine 통합: 엔터프라이즈 지식 베이스와의 연결이 더 용이해짐
또한 배치 예측을 지원하며, 캐싱을 사용하면 긴 컨텍스트 작업의 비용을 크게 낮출 수 있다.
가격
| 항목 | 가격 |
|---|---|
| 입력 | $2.00/M 토큰 |
| 출력 | $12.00/M 토큰 |
| 추론 모드 입력 | $12.00/M 토큰 |
| 캐시 읽기 | $0.20/M 토큰 |
| 캐시 쓰기 | $0.38/M 토큰 |
Claude Opus 4.6($15/$75)과 비교하면 훨씬 저렴하며, GPT-5.4 Pro와 비슷한 수준이다. 캐시를 많이 사용하면 긴 컨텍스트 작업의 비용을 상당히 낮출 수 있다.
현재 공개 프리뷰 버전이며, 지식 마감일은 2025년 1월이다.
하지만 종합 1위는 아니다
솔직히 말하면, 종합 벤치마크 순위에서 GPT-5.4 Pro는 92점(BenchLM.ai), Gemini 3.1 Pro는 87점, Claude Opus 4.6은 85점이다.
12/18개 개별 테스트에서 승리했지만, 일부 핵심 능력 차원에서는 여전히 차이가 있다. 특히 코딩 작업에서 Claude Opus 4.6의 SWE-bench 성능이 여전히 더 강력하다.
Google은 추론과 멀티모달 처리에서 이 답안을 제출했지만, 종합 1위는 아직 아니다.
전환할 가치가 있는가
비즈니스가 주로 다음에 해당한다면:
- 긴 문서 처리(계약서, 보고서, 코드베이스 검토)
- 멀티모달 입력(이미지+텍스트+오디오 동시 처리)
- 예산은 제한적이지만 Opus에 가까운 추론 능력이 필요함
3.1 Pro는 진지한 선택지이며, 가성비가 경쟁력 있다.
하지만 핵심 요구사항이 코드 작성이나 에이전트 구축이라면, Claude가 여전히 더 성숙하다. 이번 출시에서 Google이 ARC-AGI-2에서 77.1%를 기록한 것은 추론 능력이 실제로 향상되고 있으며, 단순히 점수 올리기가 아님을 보여준다. 그러나 Claude와 GPT-5.4를 완전히 대체하기에는 아직 약간의 거리가 있다.
출처: Google's new Gemini Pro model has record benchmark scores — again(TechCrunch);CocoLoop、Gemini 3.1 Pro: A smarter model for your most complex tasks(Google DeepMind Blog);Gemini 3.1 Pro Preview Model Specs, Costs & Benchmarks(Galaxy.ai);Gemini 3.1 Pro | Google Cloud Vertex AI Documentation