"Thinking model"은 2025년에 완전히 주류 개념이 되었습니다. 거의 모든 주요 AI 기업이 자체 추론 모델을 출시했으며, 핵심 판매 포인트는 모두 동일합니다. 모델이 응답하기 전에 내부적으로 "생각"한다는 것입니다.
각사 접근 방식
OpenAI o시리즈: "생각"이라는 개념을 최초로 제품화했습니다. o1에서 o3까지 진화하며 "명시적 추론 체인 + 숨겨진 사고 과정" 방식을 취합니다. 사용자는 최종 답변만 볼 수 있으며, 중간 사고 과정은 공개되지 않습니다.
DeepSeek R1: 오픈소스 노선의 추론 모델 대표 주자입니다. 강화 학습으로 구동되며 사고 과정이 투명합니다(전체 Chain-of-Thought를 볼 수 있음). 32B 증류 버전은 여러 벤치마크에서 o1-mini와 동등한 성능을 보이며, 비용 측면에서 큰 이점을 가집니다.
Gemini 2.5 Pro: Google의 thinking model로, 내부 추론 후 응답합니다. 수학 및 과학 추론에서 뛰어난 성과를 보이며(AIME 2024: 92%), 멀티모달 추론이 차별화 요소입니다.
Claude Opus 4.6: 적응형 추론을 사용합니다. 모델이 필요한 사고 깊이를 자동으로 판단하며, 4단계 조절이 가능해 연산 자원을 낭비하지 않습니다.
핵심 트레이드오프
모든 추론 모델은 동일한 문제에 직면합니다. 추론 깊이 대 응답 속도입니다.
더 깊이 생각할수록 답변 정확도는 높아지지만, 대기 시간과 비용이 증가합니다. 단순한 일상 대화에서 깊은 추론을 활성화하는 것은 순전히 시간과 비용 낭비입니다.
각사의 해결책은 약간씩 다릅니다:
- OpenAI: 다양한 등급의 모델 제공(o1-mini ~ o3-pro)
- DeepSeek V3.1: 동일 모델 내 think/non-think 이중 모드
- Anthropic: 적응형 사고. 모델이 스스로 사고 깊이 결정
- Qwen3: 역시 믹싱 모드로, thinking과 non-thinking을 하나의 모델로 처리
오픈소스 vs 폐쇄소스
추론 능력은 한때 폐쇄소스 모델의 해자(모트)로 여겨졌습니다. R1의 등장으로 이 구도는 깨졌습니다. 오픈소스 추론 모델이 폐쇄소스 모델의 주력 제품을 따라잡은 것입니다. 이는 순수 추론 능력만으로 유료 장벽을 유지하기가 점점 더 어려워지고 있음을 의미합니다.
다음 경쟁 구도는 "누가 더 잘 생각하는가"에서 "누가 더 빠르고 저렴하게 생각하는가"로 옮겨가고 있습니다.
출처: CocoLoop, 각 모델 공식 발표, The Decoder 비교 분석