El 30 de septiembre, Google lanzó su modelo de vanguardia de nueva generación, Gemini 4 Argon, pero en esta primera etapa el acceso queda limitado a los equipos de ciberdefensa dentro del programa Fairwind. Google delimitó el uso del modelo a tres áreas: ingeniería de software, trabajo de conocimiento empresarial como el ámbito legal y financiero, y defensa de ciberseguridad. Los clientes de pago por API y los suscriptores de Google AI Ultra accederán en la siguiente tanda, y todavía no hay fecha para una apertura pública más amplia.
Que los equipos de seguridad reciban acceso primero está relacionado con la orientación del entrenamiento del modelo. Según Google, Argon fue entrenado específicamente para la ciberdefensa y puede descubrir, verificar y corregir por sí mismo vulnerabilidades de software críticas. Para los defensores de confianza dentro de Fairwind y los equipos internos de Google, Argon se entrega sin las barreras habituales de ciberseguridad; el resto de usuarios recibe una versión con medidas como protección contra el uso indebido, contra la inyección de instrucciones (prompt injection) y supervisión de alineación.
El boletín oficial de resultados
Google publicó varias puntuaciones de referencia (benchmarks):
| Benchmark | Ámbito | Resultado de Argon |
|---|---|---|
| DeepSWE v1.1 | Ingeniería de software real | 77,9% |
| CWE-bench v1 | Corrección de vulnerabilidades | 68% (empatado en primer lugar) |
| AutomationBench | Tareas de automatización | 51,3% (primer lugar) |
| LVBench | Comprensión de vídeo largo | 91,7% |
Otras dos pruebas solo se dieron a conocer en forma de posición: en el Vals Index, que abarca finanzas, programación, derecho y fiscalidad, Google afirma que Argon va en cabeza; en la prueba de inyección de instrucciones indirecta de Gray Swan, Google asegura que el rendimiento de Argon frente a este tipo de ataque es el mejor. Todas estas cifras las aporta el propio fabricante, y el día del lanzamiento solo había disponible una verificación independiente de terceros.
La longitud de salida es otro cambio notable. El límite de salida por respuesta de la generación anterior de Gemini era de 64.000 tokens; en Argon sube a 1 millón de tokens, y la ventana de contexto también es de 1 millón.
Precios y pruebas independientes
Durante el periodo de lanzamiento, la API se cobra a precio promocional: 2 dólares por millón de tokens de entrada, 10 dólares por millón de tokens de salida, con un 95% adicional de descuento en la entrada cuando se acierta en caché. Al terminar la promoción, los precios vuelven a 4 dólares de entrada y 20 dólares de salida; Google no ha precisado cuánto durará el periodo promocional.
La evaluadora independiente Artificial Analysis publicó sus resultados el mismo día. Argon obtuvo 53 puntos en su índice de inteligencia, empatado con el nivel de razonamiento más alto de GPT-6 Astra, un punto por encima del nivel más alto de GPT-6.1 Sol y 23 puntos por encima de los 30 de la generación anterior, Gemini 3.1 Pro Preview.
Comparando el costo por tarea con el mismo índice:
- Argon cuesta unos 1,99 dólares por tarea a precio promocional, frente a los 3,26 dólares de GPT-6 Astra;
- al terminar la promoción, Argon sube a unos 3,98 dólares, cerca de un 20% más caro que Astra;
- GPT-6.1 Sol cuesta solo unos 0,72 dólares por tarea, con apenas 1 punto menos de puntuación, por lo que Argon, a precio promocional, resulta unas 2,8 veces más caro.
La diferencia proviene principalmente del consumo de tokens. Según Artificial Analysis, Argon genera en promedio unos 62.000 tokens de salida por tarea, frente a unos 27.000 de GPT-6 Astra, más del doble. Al reducirse el precio unitario a la mitad pero duplicarse el volumen de salida, la ventaja de precio al valor íntegro queda prácticamente anulada. Argon admite un mecanismo llamado "continuación de decodificación larga", en el que el proceso de razonamiento puede llegar a escribir hasta 1 millón de tokens de salida, lo que explica su consumo más alto en las pruebas del índice.
Para quién quedan las barreras
Esa misma semana, OpenAI canceló el lanzamiento de GPT-6.1 Astra alegando que no cumplía los estándares de seguridad, y en su lugar presentó el más económico Sol. El enfoque de Google ha sido incluir primero la versión más potente en una lista controlada. Ambas empresas actúan de forma distinta, pero afrontan el mismo tipo de capacidad: cuanto mejor es un modelo encontrando vulnerabilidades y escribiendo parches, mayor es también el riesgo de que se use para atacar.
El blog de lanzamiento de Google no detalla qué organizaciones están en la lista de Fairwind, con qué criterios se evalúan, ni cómo se evita que la versión sin barreras se filtre. Para los desarrolladores en China, Argon también resulta, por ahora, difícil de alcanzar: Fairwind funciona por invitación, no hay fecha definida para la apertura de Ultra y la API de pago, y la propia API de Gemini no presta servicio en China continental.
Fuentes: blog oficial de Google, informe de evaluación de Artificial Analysis, CocoLoop, VentureBeat; las puntuaciones de los benchmarks proceden de los datos publicados por Google, y el costo por tarea y el consumo de tokens siguen el índice de inteligencia de Artificial Analysis.