Google이 이번에 출시한 Gemini 3.1 Flash-Lite의 핵심 판매 포인트는 단 한 가지, 바로 저렴한 가격입니다.
입력 토큰 100만 개당 0.25달러, 출력은 1.50달러입니다. 이에 비해 Gemini 3.1 Pro는 입력 100만 개당 2달러, 출력 18달러로, 가격이 약 8분의 1 수준입니다.
이는 Google이 지금까지 출시한 Gemini 모델 중 가장 저렴한 것입니다.
속도와 가격 변화
Flash-Lite는 3월 3일 프리뷰 형태로 처음 공개되었으며, 현재 Google AI Studio와 Vertex AI에서 사용할 수 있습니다. 하루에 수십만 건의 요청을 처리하는 높은 처리량과 낮은 비용이 요구되는 시나리오에 적합합니다.
성능과 관련해 주목할 만한 몇 가지 수치는 다음과 같습니다.
- 생성 속도: Gemini 2.5 Flash보다 45% 향상
- 첫 번째 토큰 지연 시간: 2.5배 단축
- 처리량: 초당 약 207 토큰
- GPQA Diamond(과학적 추론 벤치마크): 86.9%, 2.5 Flash Lite 대비 약 14% 포인트 상승
이 GPQA 점수는 상당히 인상적입니다. 86.9%는 많은 '플래그십' 모델보다 높은 수치이며, 이 가격대에서 이 점수를 달성했다는 것은 확실한 자신감의 표현이라고 볼 수 있습니다.
하지만 한 가지 분명히 해야 할 점은, 더 까다로운 추론 벤치마크인 HLA에서 Flash-Lite는 16%에 불과한 반면, 3.1 Pro는 44.4%를 기록한다는 것입니다. 고급 추론 작업에서는 여전히 확연한 차이가 있습니다.
기술 기반 및 아키텍처
Flash-Lite는 Gemini 3 Pro 아키텍처를 기반으로 한 혼합 전문가(MoE) 설계를 채택했으며, 다음을 지원합니다.
- 컨텍스트 윈도우: 100만 토큰
- 입력 모달리티: 텍스트, 이미지, 오디오, 비디오 모두 지원
- 출력 길이: 최대 64K 토큰
MoE 아키텍처는 이 가격에 이 성능을 낼 수 있는 핵심 요소로, 활성화되는 파라미터 수가 적어 단일 추론 비용이 낮습니다. 이는 DeepSeek V3, Qwen3와 같은 접근 방식입니다.
적합한 용도
Google은 이 모델에 대해 매우 실용적인 시나리오를 제시했습니다.
- 콘텐츠 검열: 규정 위반 탐지 배치 처리
- 데이터 추출: 비정형 텍스트에서 필드 추출
- 의도 라우팅: 멀티 에이전트 시스템 내 1차 분류
- 고객 서비스 자동화: 표준화된 질문에 대한 응답
- 번역 및 전사: 대규모 텍스트 언어 처리
간단히 말해, 깊은 추론은 필요하지 않지만, 처리량이 많고 지연 시간에 민감하며 예산이 제한된 시나리오에 적합합니다.
이러한 조합은 기업 환경에서 매우 일반적입니다. 많은 기업의 AI 지출 중 절반 이상이 이러한 '기술적으로는 단순하지만 반드시 실행해야 하는' 작업에 사용됩니다.
경쟁사 가격 비교
| 모델 | 입력 ($/100만 토큰) | 출력 ($/100만 토큰) |
|---|---|---|
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 |
| Gemini 3.1 Pro | $2.00 | $18.00 |
| GPT-4o Mini | ~$0.15 | ~$0.60 |
| Claude 4.5 Haiku | ~$0.25 | ~$1.25 |
이 가격대에서는 경쟁이 치열합니다. GPT-4o Mini는 더 저렴하고, Claude 4.5 Haiku도 비슷한 가격대에 있습니다. Flash-Lite의 강점은 속도(첫 번째 토큰까지 2.5배 더 빠름)와 동일 가격대 모델에서는 드문 100만 토큰의 긴 컨텍스트 윈도우입니다.
이번 출시의 의미
Google이 Flash-Lite를 내놓은 것은 본질적으로 높은 처리량이 필요한 시장의 점유율을 확보하기 위한 움직임입니다.
많은 중소 개발자와 스타트업이 제품 프로토타입을 만들 때 가장 우선시하는 기준은 '충분하고 저렴한 것'입니다. Gemini 3.1 Pro의 가격은 이들에게 확실한 진입 장벽이었지만, Flash-Lite의 가격은 기본적으로 장애가 되지 않습니다.
동시에 Google은 이 저가 모델을 활용해 개발자들을 Vertex AI 생태계에 머물게 하려는 전략입니다. 먼저 Flash-Lite로 트래픽을 유입시키고, 실제 프로덕션의 무거운 작업은 Pro와 Ultra로 이전하도록 유도하는 것입니다. Google은 이미 많은 고객을 통해 이 전환 경로를 검증했습니다.
비용에 민감한 API 시나리오에서 이제 선택지가 하나 더 늘었습니다.
참고 출처: CocoLoop, Google launches speedy Gemini 3.1 Flash-Lite model in preview (SiliconANGLE); Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases (AI/ML API Blog); Gemini 3.1 Flash Lite: Our most cost-effective AI model yet (Google Blog)