A Google lançou o Gemini 3.1 Flash-Lite, e o principal argumento de venda se resume a uma palavra: barato.
Cada milhão de tokens de entrada custa apenas US$ 0,25, e a saída, US$ 1,50. Em comparação, o Gemini 3.1 Pro custa US$ 2,00 por milhão de tokens de entrada e US$ 18,00 para a saída – o preço é cerca de um oitavo.
Este é o modelo Gemini mais barato já lançado pela Google.
Velocidade e preço mudaram
O Flash-Lite foi lançado em versão Preview no dia 3 de março e está disponível no Google AI Studio e no Vertex AI. Ele é posicionado para cenários de alta concorrência e baixo custo – aplicações que precisam processar centenas de milhares de requisições por dia.
Alguns números de desempenho que merecem destaque:
- Velocidade de geração: 45% mais rápida que o Gemini 2.5 Flash
- Latência do primeiro token: reduzida em 2,5 vezes
- Taxa de transferência: cerca de 207 tokens/segundo
- GPQA Diamond (benchmark de raciocínio científico): 86,9%, um aumento de cerca de 14 pontos percentuais em relação ao 2.5 Flash Lite
Essa pontuação no GPQA é bastante sólida. Vale notar que 86,9% já é superior a muitos modelos "topo de linha", e com esse preço, o número realmente impressiona.
No entanto, é preciso esclarecer: no benchmark de raciocínio mais extremo, o HLA, o Flash-Lite atinge apenas 16%, enquanto o 3.1 Pro chega a 44,4%. Tarefas de raciocínio de alto nível ainda apresentam uma diferença significativa.
Base técnica e arquitetura
O Flash-Lite é construído sobre a arquitetura MoE (Mixture of Experts) baseada no Gemini 3 Pro, com suporte para:
- Janela de contexto: 1 milhão de tokens
- Modalidades de entrada: texto, imagem, áudio e vídeo são todos suportados
- Comprimento máximo de saída: 64K tokens
A arquitetura MoE é a chave para que este modelo atinja esse desempenho com esse preço – menos parâmetros ativados, menor custo por inferência. Essa abordagem é semelhante à do DeepSeek V3 e do Qwen3.
Para que serve
A Google definiu casos de uso muito práticos para este modelo:
- Moderação de conteúdo: execução em lote para detecção de violações
- Extração de dados: extração de campos de texto não estruturado
- Roteamento de intenção: camada de distribuição inicial em sistemas multiagente
- Automação de atendimento ao cliente: resposta a perguntas padronizadas
- Tradução e transcrição: processamento de linguagem para grandes volumes de texto
Em suma: são tarefas que não exigem raciocínio profundo, mas têm alto volume, são sensíveis à latência e têm orçamento limitado.
Essa combinação é muito comum em empresas. Muitas companhias gastam mais da metade de seus gastos com IA em tarefas "sem complexidade técnica, mas que precisam ser executadas".
Comparação de preços com concorrentes
| Modelo | Entrada ($/1M tokens) | Saída ($/1M tokens) |
|---|---|---|
| Gemini 3.1 Flash-Lite | $0,25 | $1,50 |
| Gemini 3.1 Pro | $2,00 | $18,00 |
| GPT-4o Mini | ~$0,15 | ~$0,60 |
| Claude 4.5 Haiku | ~$0,25 | ~$1,25 |
Nesta faixa de preço, a concorrência é bastante acirrada. O GPT-4o Mini é mais barato, e o Claude 4.5 Haiku está na mesma faixa. As vantagens do Flash-Lite são a velocidade (primeiro token 2,5x mais rápido) e a janela de contexto ultra longa de 1M, algo raro em outros modelos neste preço.
Análise do lançamento
O lançamento do Flash-Lite pela Google é, essencialmente, um movimento para ganhar participação no mercado de alta concorrência.
Muitos desenvolvedores independentes e startups, ao criar protótipos de produtos, têm como critério principal "suficientemente bom e barato". O preço do Gemini 3.1 Pro é uma barreira real para eles, mas o preço do Flash-Lite praticamente não representa mais um obstáculo.
Ao mesmo tempo, a Google usa este modelo de baixo custo para manter os desenvolvedores no ecossistema Vertex AI. Primeiro, atrai o tráfego com o Flash-Lite; depois, as tarefas pesadas de produção são migradas para o Pro e o Ultra – um caminho de conversão que a Google já validou com muitos clientes.
Cenários de API sensíveis a custos agora têm mais uma opção.
Fontes de referência: CocoLoop, Google launches speedy Gemini 3.1 Flash-Lite model in preview (SiliconANGLE); Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases (AI/ML API Blog); Gemini 3.1 Flash Lite: Our most cost-effective AI model yet (Google Blog)