Gemini 3.8 Flash debuta e iguala a un rival seis veces más caro en pruebas de código

Google DeepMind lanzó Gemini 3.8 Flash el 2 de septiembre. Según la ficha técnica oficial (model card), el modelo se construye sobre 3.7 Flash, con mejoras centradas en ingeniería de software y flujos de trabajo de conocimiento basados en agentes. El lanzamiento llega apenas unos días después de que se filtrara una versión de prueba interna para empleados.

Las especificaciones no cambiaron mucho: la ventana de contexto de entrada llega hasta 1 millón de tokens, el límite de salida por turno es de 64.000 tokens, el conocimiento llega hasta marzo de 2026, aunque algunas áreas siguen ancladas en enero de 2025. La distribución se hizo de golpe en todos los canales: la app de Gemini, AI Studio, la Gemini API, la Gemini Enterprise Agent Platform, el Google AI Mode y la herramienta de programación Antigravity. El modelo admite niveles de esfuerzo ajustables, que permiten a los desarrolladores equilibrar por sí mismos calidad, costo y latencia.

Dos caras en la misma tabla

La tabla comparativa oficial coloca a 3.8 Flash junto a 3.7 Flash, Claude Opus 5, Claude Sonnet 5, GPT-5.6 Sol y GPT-5.6 Terra; lo llamativo es el desajuste entre precio y puntuación.

3.8 Flash mantiene el precio promocional de 0,75 dólares por millón de tokens de entrada y 3,75 dólares de salida; Claude Opus 5 cuesta 5 y 25 dólares, más de seis veces más. Con esa diferencia de precio, en Terminal-bench 2.1 ambos quedan en 89,4 frente a 89,1, prácticamente empatados; en CharXiv Reasoning es 86,2 frente a 83,7, en HLE-Verified 54,9 frente a 54,4, en la tarea de análisis financiero 61,4 frente a 58,6, en el flujo legal Harvey 10,0 frente a 6,7 — en todos ellos 3.8 Flash va adelante; en la comprensión de video largo la brecha es mayor, 87,8 frente a 75,4.

Cuando la tarea se alarga, el panorama se invierte. En Terminal-bench 4.0, que evalúa capacidades de agente más generales, Opus 5 logra 51,8 frente a apenas 19,1 de 3.8 Flash; en OSWorld-2.0, que mide el manejo de computadoras por parte de agentes, es 75,4 frente a 59,0; en la puntuación Elo de GDPVal-AA v2, que mide trabajo de conocimiento, es 1824 frente a 1545. En tareas de ingeniería de software de ciclo largo como DeepSWE, el resultado es 74,0 frente a 71,0 — la diferencia es menor, pero la dirección es la misma.

El patrón es bastante claro: cuanto más corta sea la tarea y más se parezca a un juicio de un solo turno, menor será el impacto del nivel de precio; cuanto más larga la tarea, y cuanto más necesite el modelo mantener su propio estado y autocorregirse, más vuelve a abrirse la brecha entre niveles de precio. Haciendo un cálculo aproximado, para completar el mismo pipeline de codificación de complejidad media, el costo de inferencia de 3.8 Flash es cerca de una sexta parte del de Opus 5, con una diferencia de resultados de menos de un punto porcentual; pero al pasar a un flujo de agente que requiere decenas de pasos consecutivos, cuánto de ese ahorro se lo comen los reintentos tras fallos solo se sabe probándolo.

La mejora respecto a 3.7 Flash sí es real. DeepSWE sube de 65,3 a 71,0, Terminal-bench 4.0 de 11,2 a 19,1, OSWorld de 50,6 a 59,0, y el nivel difícil de los flujos de investigación biológica salta de 43,4 a 56,5. Con un ritmo de lanzamientos de pocas semanas, ese salto no es pequeño.

Los usuarios lo supieron antes que el anuncio

Antes incluso de que se publicara la ficha técnica oficial, la comunidad de desarrolladores ya había notado algo raro: en la versión web y en Antigravity el modelo seguía etiquetado como 3.7 Flash, pero al preguntarle 'qué modelo eres', respondía que era 3.8 Flash. Otros usuarios, en pleno uso, vieron aparecer de repente una nueva línea de '3.8 Flash' en el selector de modelos, con el nivel de esfuerzo predeterminado en High.

Cambiar de modelo en silencio es una práctica habitual en los laboratorios de vanguardia: permite probarlo bajo carga real y revertir de inmediato si surgen problemas. El costo recae sobre quien lo usa: el comportamiento bajo el mismo nombre de modelo cambia en algún momento, la eficacia de los prompts, el consumo de tokens y el estilo de salida pueden cambiar con él, y por lo general esto no queda registrado en ningún changelog. Para los equipos que pagan por token, la fluctuación en la factura suele llegar antes que el anuncio oficial.

Las primeras pruebas de la comunidad siguieron los métodos de siempre: pedirle al modelo que genere de una vez una animación del sistema solar, o que dibuje un SVG de un pelícano. Este tipo de pruebas no tiene rigor científico, pero gana por su bajo umbral de entrada —se ve a simple vista si algo está bien o mal— y suele ser la única referencia disponible antes de que salgan los resultados oficiales. La opinión tampoco es unánime: unos elogian, otros critican, como en cada actualización de modelo.

Lo barato tiene fecha de caducidad

La ficha técnica enumera algunas limitaciones conocidas: siguen dándose respuestas ocasionalmente lentas y tiempos de espera agotados; cuando se sube el nivel de esfuerzo, el modelo consume más tokens para mejorar el rendimiento, así que el costo real no necesariamente crece de forma lineal respecto al precio de lista. En seguridad, la compañía afirma que el nivel general es equivalente al de 3.7 Flash, un equipo humano de red team confirmó que se alcanza el umbral de seguridad infantil para su lanzamiento, mientras que los indicadores de seguridad en escenarios no ingleses tuvieron una ligera caída.

Bajo la columna de precios hay además una nota pequeña: los precios promocionales de 3.7 y 3.8 Flash terminan el 31 de diciembre, y a partir del 1 de enero del año siguiente volverán a 1,5 dólares por millón de tokens de entrada y 7,5 dólares de salida — justo el doble. Esta tabla de relación precio-rendimiento habrá que recalcularla dentro de cuatro meses.

Fuentes: ficha técnica de Google DeepMind, CocoLoop, tabla oficial de comparación de rendimiento de Google, discusiones de la comunidad de desarrolladores; la longitud de contexto, el límite de salida, el corte de conocimiento y los canales de distribución se verificaron con la ficha técnica, las puntuaciones de referencia y el precio por millón de tokens proceden de la tabla comparativa oficial.