Google lança Gemini Flash-Lite, o mais barato de todos

A Google lançou o Gemini 3.1 Flash-Lite, e o principal argumento de venda se resume a uma palavra: barato.

Cada milhão de tokens de entrada custa apenas US$ 0,25, e a saída, US$ 1,50. Em comparação, o Gemini 3.1 Pro custa US$ 2,00 por milhão de tokens de entrada e US$ 18,00 para a saída – o preço é cerca de um oitavo.

Este é o modelo Gemini mais barato já lançado pela Google.

Velocidade e preço mudaram

O Flash-Lite foi lançado em versão Preview no dia 3 de março e está disponível no Google AI Studio e no Vertex AI. Ele é posicionado para cenários de alta concorrência e baixo custo – aplicações que precisam processar centenas de milhares de requisições por dia.

Alguns números de desempenho que merecem destaque:

  • Velocidade de geração: 45% mais rápida que o Gemini 2.5 Flash
  • Latência do primeiro token: reduzida em 2,5 vezes
  • Taxa de transferência: cerca de 207 tokens/segundo
  • GPQA Diamond (benchmark de raciocínio científico): 86,9%, um aumento de cerca de 14 pontos percentuais em relação ao 2.5 Flash Lite

Essa pontuação no GPQA é bastante sólida. Vale notar que 86,9% já é superior a muitos modelos "topo de linha", e com esse preço, o número realmente impressiona.

No entanto, é preciso esclarecer: no benchmark de raciocínio mais extremo, o HLA, o Flash-Lite atinge apenas 16%, enquanto o 3.1 Pro chega a 44,4%. Tarefas de raciocínio de alto nível ainda apresentam uma diferença significativa.

Base técnica e arquitetura

O Flash-Lite é construído sobre a arquitetura MoE (Mixture of Experts) baseada no Gemini 3 Pro, com suporte para:

  • Janela de contexto: 1 milhão de tokens
  • Modalidades de entrada: texto, imagem, áudio e vídeo são todos suportados
  • Comprimento máximo de saída: 64K tokens

A arquitetura MoE é a chave para que este modelo atinja esse desempenho com esse preço – menos parâmetros ativados, menor custo por inferência. Essa abordagem é semelhante à do DeepSeek V3 e do Qwen3.

Para que serve

A Google definiu casos de uso muito práticos para este modelo:

  • Moderação de conteúdo: execução em lote para detecção de violações
  • Extração de dados: extração de campos de texto não estruturado
  • Roteamento de intenção: camada de distribuição inicial em sistemas multiagente
  • Automação de atendimento ao cliente: resposta a perguntas padronizadas
  • Tradução e transcrição: processamento de linguagem para grandes volumes de texto

Em suma: são tarefas que não exigem raciocínio profundo, mas têm alto volume, são sensíveis à latência e têm orçamento limitado.

Essa combinação é muito comum em empresas. Muitas companhias gastam mais da metade de seus gastos com IA em tarefas "sem complexidade técnica, mas que precisam ser executadas".

Comparação de preços com concorrentes

ModeloEntrada ($/1M tokens)Saída ($/1M tokens)
Gemini 3.1 Flash-Lite$0,25$1,50
Gemini 3.1 Pro$2,00$18,00
GPT-4o Mini~$0,15~$0,60
Claude 4.5 Haiku~$0,25~$1,25

Nesta faixa de preço, a concorrência é bastante acirrada. O GPT-4o Mini é mais barato, e o Claude 4.5 Haiku está na mesma faixa. As vantagens do Flash-Lite são a velocidade (primeiro token 2,5x mais rápido) e a janela de contexto ultra longa de 1M, algo raro em outros modelos neste preço.

Análise do lançamento

O lançamento do Flash-Lite pela Google é, essencialmente, um movimento para ganhar participação no mercado de alta concorrência.

Muitos desenvolvedores independentes e startups, ao criar protótipos de produtos, têm como critério principal "suficientemente bom e barato". O preço do Gemini 3.1 Pro é uma barreira real para eles, mas o preço do Flash-Lite praticamente não representa mais um obstáculo.

Ao mesmo tempo, a Google usa este modelo de baixo custo para manter os desenvolvedores no ecossistema Vertex AI. Primeiro, atrai o tráfego com o Flash-Lite; depois, as tarefas pesadas de produção são migradas para o Pro e o Ultra – um caminho de conversão que a Google já validou com muitos clientes.

Cenários de API sensíveis a custos agora têm mais uma opção.

Fontes de referência: CocoLoop, Google launches speedy Gemini 3.1 Flash-Lite model in preview (SiliconANGLE); Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases (AI/ML API Blog); Gemini 3.1 Flash Lite: Our most cost-effective AI model yet (Google Blog)