Según Business Insider, algunos empleados de Google ya tienen acceso a una versión preliminar de Gemini 3.8 Flash, a través de la plataforma interna de programación llamada Jetski. Un empleado que participó en las pruebas describió esta versión como «claramente mejor que 3.7 Flash», aunque matizó que aún es pronto para sacar conclusiones definitivas. Google declinó hacer comentarios al respecto.
La cronología deja ver el ritmo con claridad: 3.6 Flash se lanzó en julio, 3.7 Flash llegó tres semanas después, y ahora 3.8 Flash ha entrado en pruebas internas con empleados. Sundar Pichai dijo en la conferencia de resultados del segundo trimestre que la compañía avanza hacia una frecuencia de lanzamientos casi mensual. En su momento sonó como un objetivo; ahora parece más bien un calendario que ya se está ejecutando.
El insignia se retrasa, Flash toma la delantera
El calendario de la próxima generación del modelo insignia de Google se ha pospuesto una y otra vez, y la compañía ha concentrado recursos en la línea Flash. Business Insider describe la serie Flash como el «modelo de trabajo», usado sobre todo para escribir código y ejecutar agentes, dos cargas de trabajo que comparten llamadas frecuentes, contextos largos y una tolerancia mayor a la calidad de cada respuesta que al costo.
Esta ecuación cuadra bien sobre el papel. En el mismo pipeline de agentes, cambiar el modelo del nivel Pro al nivel Flash suele recortar el costo de inferencia en un orden de magnitud (estimación aproximada; la diferencia real varía según la longitud del contexto y la tasa de acierto de la caché). A medida que los clientes empresariales empiezan a vigilar la factura de IA mes a mes, la elección del nivel de modelo se está trasladando de los equipos de algoritmos al área financiera.
La puerta de entrada llamada Jetski
Que la plataforma interna de programación reciba primero el modelo nuevo ya dice mucho por sí solo. La carga real de código que escriben a diario decenas de miles de ingenieros de Google forma un campo de pruebas lo bastante grande y con retroalimentación lo bastante densa como para acercarse más al entorno de producción que cualquier ranking público. Dejar que el modelo funcione varias semanas en la plataforma interna antes de liberarlo equivale, en la práctica, a subcontratar la ronda más costosa de red-teaming a su propio personal.
Un patrón parecido también se percibe en OpenAI y Anthropic. La escala de uso interno de los laboratorios de vanguardia ya es lo bastante grande como para funcionar como el primer grupo de usuarios, con lo que la velocidad de iteración de los modelos deja de depender del ritmo externo de despliegue gradual.
El efecto secundario de iterar más rápido
Cuando el ciclo de los modelos se contrae de «una generación al año» a «una versión cada pocas semanas», la vida media de las tablas de benchmark también se acorta. La versión anterior apenas se ha integrado en la línea de producto cuando ya está corriendo internamente la vista previa de la siguiente; la elección de modelo por parte de los desarrolladores deja de ser una decisión puntual y se convierte en un costo de mantenimiento continuo: hay que reajustar los prompts, volver a probar los formatos de llamada a herramientas y recalcular los modelos de costo.
Para el propio Google, el ritmo intenso de lanzamientos también diluye la atención que recibe cada versión. La diferencia real de capacidad entre las versiones 3.6, 3.7 y 3.8 no cuenta todavía con un benchmark público comparable. Google tampoco ha dado un calendario público de lanzamiento para 3.8 Flash, y los parámetros, el precio y la longitud de contexto siguen sin divulgarse.
Fuentes: Business Insider, CocoLoop, transcripción de la conferencia de resultados del segundo trimestre de Google; los nombres en clave de las versiones del modelo, el nombre de la plataforma interna y las declaraciones de los evaluadores siguen el reportaje de Business Insider, y la comparación de costos es una estimación aproximada de la redacción.