Google lleva Flash a la batalla de costos

Google presentó tres modelos Flash el 21 de julio. A primera vista parece otra actualización de Gemini. Pero al mirar precio, velocidad y uso, la señal es más clara: Google quiere que la IA de agentes y de empresa sea más barata, rápida y específica para cada trabajo.

Gemini 3.6 Flash queda como modelo general, Gemini 3.5 Flash-Lite apunta a bajo costo y alto rendimiento, y Gemini 3.5 Flash Cyber se enfoca en seguridad. La competencia de modelos se mueve de una sola tabla de puntuaciones al diseño por carga de trabajo.

Las llamadas frecuentes necesitan modelos baratos

Google afirma que el nuevo Flash-Lite tiene salida en tiempo real 17% más rápida que la generación previa y alcanza cerca de 350 tokens/s en pruebas independientes. La página de DeepMind lista precios de 0,30 dólares por millón de tokens de entrada y 2,50 dólares por millón de tokens de salida.

En un chat normal se nota la calidad de la respuesta. En agentes, atención al cliente, automatización de navegador y procesamiento masivo de documentos, cientos de llamadas pequeñas deben mantenerse dentro de límites de latencia y presupuesto.

La seguridad se vuelve un modelo aparte

Flash Cyber es el punto más definido del anuncio. Google lo sitúa en análisis de seguridad, investigación de vulnerabilidades, análisis de malware y respuesta a incidentes, no en conversación general.

DeepMind muestra resultados en CTI-MCQ, CTI-RCM, MARS-EVAL y CyberSecEval. Google habla de mejoras de hasta 65% frente a 3.5 Flash en benchmarks de ciberseguridad seleccionados. Esa cifra pertenece a esos benchmarks; en empresas aún habrá que medir falsos positivos, hallazgos omitidos y costo de revisión humana.

El CEO de Google, Sundar Pichai, ha descrito la oportunidad de la IA como una de las más grandes.

Los clientes compran equilibrio

La página de Google incluye una frase de Vincent van der Meulen, de Figma: al evaluar modelos para Figma Make, buscan equilibrio entre calidad, velocidad y costo.

Esa es la lógica comercial de Flash. Herramientas de diseño, asistentes de código, análisis de hojas de cálculo y sistemas de soporte no necesitan el mismo modelo en cada paso. Las etapas frecuentes y verificables pueden usar modelos baratos; las tareas sensibles pueden pasar a modelos más fuertes.

La carga real decidirá

Los 350 tokens/s de Flash-Lite vienen de un contexto de benchmark. En producción, la latencia dependerá del tamaño del prompt, llamadas a herramientas, red y límites de tasa. La mejora de 65% de Flash Cyber también está ligada a los benchmarks de seguridad citados.

Google no lanzó solo un modelo más fuerte. Dividió cargas distintas en productos distintos. La siguiente competencia se peleará en facturas, latencia, límites de seguridad y ajuste al workflow.

Fuentes: blog oficial de Google, páginas de modelos de Google DeepMind, Axios, Business Insider, Artificial Analysis, CocoLoop; se verificaron roles de los tres modelos Flash, alcance de tokens/s, precios por millón de tokens, mejoras en benchmarks de ciberseguridad, cita de cliente y disponibilidad.