Google lanza el Gemini Flash-Lite más barato de la historia

Google ha lanzado Gemini 3.1 Flash-Lite, y su principal argumento de venta se resume en una palabra: barato.

Cada millón de tokens de entrada cuesta solo 0,25 USD, y la salida, 1,50 USD. En comparación, Gemini 3.1 Pro cuesta 2,00 USD por millón de tokens de entrada y 18,00 USD por la salida: el precio es aproximadamente una octava parte.

Es el modelo Gemini más barato que Google haya lanzado jamás.

Velocidad y precio han cambiado

Flash-Lite se lanzó en versión Preview el 3 de marzo y está disponible en Google AI Studio y Vertex AI. Está posicionado para escenarios de alta concurrencia y bajo costo: aplicaciones que necesitan procesar cientos de miles de solicitudes al día.

Algunas cifras de rendimiento notables:

  • Velocidad de generación: un 45 % más rápida que Gemini 2.5 Flash
  • Latencia del primer token: reducida 2,5 veces
  • Rendimiento: aproximadamente 207 tokens/segundo
  • GPQA Diamond (punto de referencia de razonamiento científico): 86,9 %, un aumento de unos 14 puntos porcentuales frente a 2.5 Flash Lite

Esta puntuación en GPQA es bastante sólida. Hay que tener en cuenta que el 86,9 % ya supera a muchos modelos "insignia", y a este precio, la cifra realmente impresiona.

Sin embargo, hay que aclarar algo: en el punto de referencia de razonamiento más extremo, HLA, Flash-Lite solo alcanza el 16 %, mientras que 3.1 Pro llega al 44,4 %. Las tareas de razonamiento de alto nivel siguen mostrando una diferencia significativa.

Base técnica y arquitectura

Flash-Lite se basa en la arquitectura MoE (Mezcla de Expertos) de Gemini 3 Pro y es compatible con:

  • Ventana de contexto: 1 millón de tokens
  • Modalidades de entrada: texto, imágenes, audio y video, todos compatibles
  • Longitud máxima de salida: 64K tokens

La arquitectura MoE es la clave para que este modelo ofrezca este rendimiento a este precio: menos parámetros activados, menor costo por inferencia. Este enfoque es similar al de DeepSeek V3 y Qwen3.

Para qué sirve

Google ha definido casos de uso muy prácticos para este modelo:

  • Moderación de contenido: ejecución por lotes para detectar infracciones
  • Extracción de datos: extracción de campos de texto no estructurado
  • Enrutamiento de intenciones: capa de distribución inicial en sistemas multiagente
  • Automatización de atención al cliente: respuesta a preguntas estandarizadas
  • Traducción y transcripción: procesamiento de lenguaje para grandes volúmenes de texto

En pocas palabras: son tareas que no requieren razonamiento profundo, pero tienen un volumen alto, son sensibles a la latencia y tienen un presupuesto limitado.

Esta combinación es muy común en las empresas. Muchas compañías gastan más de la mitad de su presupuesto de IA en tareas "sin complejidad técnica pero que deben ejecutarse".

Comparación de precios con la competencia

ModeloEntrada ($/1M tokens)Salida ($/1M tokens)
Gemini 3.1 Flash-Lite$0,25$1,50
Gemini 3.1 Pro$2,00$18,00
GPT-4o Mini~$0,15~$0,60
Claude 4.5 Haiku~$0,25~$1,25

En este rango de precios, la competencia es bastante intensa. GPT-4o Mini es más barato, y Claude 4.5 Haiku está en la misma franja. Las ventajas de Flash-Lite son la velocidad (primer token 2,5 veces más rápido) y la ventana de contexto ultra larga de 1M, algo poco común en otros modelos de este precio.

Análisis del lanzamiento

El lanzamiento de Flash-Lite por parte de Google es, en esencia, un movimiento para ganar cuota de mercado en el segmento de alta concurrencia.

Muchos desarrolladores independientes y startups, al crear prototipos de productos, tienen como criterio principal "suficientemente bueno y barato". El precio de Gemini 3.1 Pro es una barrera real para ellos, pero el precio de Flash-Lite prácticamente ya no supone un obstáculo.

Al mismo tiempo, Google utiliza este modelo de bajo costo para retener a los desarrolladores en el ecosistema de Vertex AI. Primero, atrae tráfico con Flash-Lite; luego, las tareas pesadas de producción se migran a Pro y Ultra: una ruta de conversión que Google ya ha validado con muchos clientes.

Los escenarios de API sensibles al costo ahora tienen una opción más.

Fuentes de referencia: CocoLoop, Google launches speedy Gemini 3.1 Flash-Lite model in preview (SiliconANGLE); Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases (AI/ML API Blog); Gemini 3.1 Flash Lite: Our most cost-effective AI model yet (Google Blog)