Google, 가장 저렴한 Gemini 모델 Flash-Lite 출시

Google이 이번에 출시한 Gemini 3.1 Flash-Lite의 핵심 판매 포인트는 단 한 가지, 바로 저렴한 가격입니다.

입력 토큰 100만 개당 0.25달러, 출력은 1.50달러입니다. 이에 비해 Gemini 3.1 Pro는 입력 100만 개당 2달러, 출력 18달러로, 가격이 약 8분의 1 수준입니다.

이는 Google이 지금까지 출시한 Gemini 모델 중 가장 저렴한 것입니다.

속도와 가격 변화

Flash-Lite는 3월 3일 프리뷰 형태로 처음 공개되었으며, 현재 Google AI Studio와 Vertex AI에서 사용할 수 있습니다. 하루에 수십만 건의 요청을 처리하는 높은 처리량과 낮은 비용이 요구되는 시나리오에 적합합니다.

성능과 관련해 주목할 만한 몇 가지 수치는 다음과 같습니다.

  • 생성 속도: Gemini 2.5 Flash보다 45% 향상
  • 첫 번째 토큰 지연 시간: 2.5배 단축
  • 처리량: 초당 약 207 토큰
  • GPQA Diamond(과학적 추론 벤치마크): 86.9%, 2.5 Flash Lite 대비 약 14% 포인트 상승

이 GPQA 점수는 상당히 인상적입니다. 86.9%는 많은 '플래그십' 모델보다 높은 수치이며, 이 가격대에서 이 점수를 달성했다는 것은 확실한 자신감의 표현이라고 볼 수 있습니다.

하지만 한 가지 분명히 해야 할 점은, 더 까다로운 추론 벤치마크인 HLA에서 Flash-Lite는 16%에 불과한 반면, 3.1 Pro는 44.4%를 기록한다는 것입니다. 고급 추론 작업에서는 여전히 확연한 차이가 있습니다.

기술 기반 및 아키텍처

Flash-Lite는 Gemini 3 Pro 아키텍처를 기반으로 한 혼합 전문가(MoE) 설계를 채택했으며, 다음을 지원합니다.

  • 컨텍스트 윈도우: 100만 토큰
  • 입력 모달리티: 텍스트, 이미지, 오디오, 비디오 모두 지원
  • 출력 길이: 최대 64K 토큰

MoE 아키텍처는 이 가격에 이 성능을 낼 수 있는 핵심 요소로, 활성화되는 파라미터 수가 적어 단일 추론 비용이 낮습니다. 이는 DeepSeek V3, Qwen3와 같은 접근 방식입니다.

적합한 용도

Google은 이 모델에 대해 매우 실용적인 시나리오를 제시했습니다.

  • 콘텐츠 검열: 규정 위반 탐지 배치 처리
  • 데이터 추출: 비정형 텍스트에서 필드 추출
  • 의도 라우팅: 멀티 에이전트 시스템 내 1차 분류
  • 고객 서비스 자동화: 표준화된 질문에 대한 응답
  • 번역 및 전사: 대규모 텍스트 언어 처리

간단히 말해, 깊은 추론은 필요하지 않지만, 처리량이 많고 지연 시간에 민감하며 예산이 제한된 시나리오에 적합합니다.

이러한 조합은 기업 환경에서 매우 일반적입니다. 많은 기업의 AI 지출 중 절반 이상이 이러한 '기술적으로는 단순하지만 반드시 실행해야 하는' 작업에 사용됩니다.

경쟁사 가격 비교

모델입력 ($/100만 토큰)출력 ($/100만 토큰)
Gemini 3.1 Flash-Lite$0.25$1.50
Gemini 3.1 Pro$2.00$18.00
GPT-4o Mini~$0.15~$0.60
Claude 4.5 Haiku~$0.25~$1.25

이 가격대에서는 경쟁이 치열합니다. GPT-4o Mini는 더 저렴하고, Claude 4.5 Haiku도 비슷한 가격대에 있습니다. Flash-Lite의 강점은 속도(첫 번째 토큰까지 2.5배 더 빠름)와 동일 가격대 모델에서는 드문 100만 토큰의 긴 컨텍스트 윈도우입니다.

이번 출시의 의미

Google이 Flash-Lite를 내놓은 것은 본질적으로 높은 처리량이 필요한 시장의 점유율을 확보하기 위한 움직임입니다.

많은 중소 개발자와 스타트업이 제품 프로토타입을 만들 때 가장 우선시하는 기준은 '충분하고 저렴한 것'입니다. Gemini 3.1 Pro의 가격은 이들에게 확실한 진입 장벽이었지만, Flash-Lite의 가격은 기본적으로 장애가 되지 않습니다.

동시에 Google은 이 저가 모델을 활용해 개발자들을 Vertex AI 생태계에 머물게 하려는 전략입니다. 먼저 Flash-Lite로 트래픽을 유입시키고, 실제 프로덕션의 무거운 작업은 Pro와 Ultra로 이전하도록 유도하는 것입니다. Google은 이미 많은 고객을 통해 이 전환 경로를 검증했습니다.

비용에 민감한 API 시나리오에서 이제 선택지가 하나 더 늘었습니다.

참고 출처: CocoLoop, Google launches speedy Gemini 3.1 Flash-Lite model in preview (SiliconANGLE); Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases (AI/ML API Blog); Gemini 3.1 Flash Lite: Our most cost-effective AI model yet (Google Blog)