La puntuación CTF del GPT-5.4-Cyber salta del 27 % al 76 %

La semana pasada, Anthropic lanzó Mythos, afirmando que solo se lo daría a 40 organizaciones, ayudando a algunos equipos a encontrar vulnerabilidades de 27 años. Esta semana, OpenAI responde directamente: llega GPT-5.4-Cyber, dirigido a miles de investigadores de seguridad y cientos de equipos, superando en escala el enfoque de club de élite de Mythos.

Las dos empresas, en la misma ventana de tiempo, utilizan dos estrategias completamente diferentes para competir en el mismo circuito.

¿Qué es GPT-5.4-Cyber?

No es un modelo completamente nuevo, sino una variante especializada en ciberseguridad del GPT-5.4. La diferencia central es la relajación selectiva de las restricciones para escenarios de seguridad defensiva.

La capacidad nueva más importante: ingeniería inversa binaria (binary reverse engineering).

El análisis de seguridad habitual generalmente requiere acceso al código fuente o desensamblado manual. GPT-5.4-Cyber puede recibir directamente archivos binarios compilados, ayudando a encontrar vulnerabilidades e identificar lógica maliciosa. En la práctica, solo una minoría de malware tiene código fuente disponible — la mayor parte del análisis de ataques APT, la ingeniería inversa de ransomware y las revisiones de seguridad de la cadena de suministro lidian con cajas negras compiladas. Esta función aborda directamente los escenarios más difíciles para los ingenieros de seguridad.

Del 27 % al 76 %: ¿Qué significan estas cifras?

OpenAI utiliza el punto de referencia CTF (Capture The Flag) para medir el progreso de las capacidades de seguridad:

PeríodoModeloPuntuación en el benchmark CTF
Agosto de 2025GPT-527 %
Noviembre de 2025GPT-5.1-Codex-Max76 %

Del 27 % al 76 % en tres meses — esto significa que la capacidad práctica de resolución de problemas de la IA en ciberseguridad casi se ha triplicado. Hace un año, la IA solo podía responder preguntas básicas de seguridad; ahora resuelve la mayoría de los problemas CTF de dificultad media.

Al mismo tiempo, la herramienta de análisis de seguridad de código Codex Security, basada en GPT-5.4-Cyber, desde sus pruebas internas ya ha ayudado a corregir más de 3.000 vulnerabilidades de alto riesgo o críticas.

Programa TAC: Acceso por niveles, no para cualquiera

El canal de acceso a GPT-5.4-Cyber es el programa Trusted Access for Cyber (TAC), lanzado en febrero junto con una subvención de 10 millones de dólares para ciberseguridad, que en ese momento funcionaba con GPT-5.3-Codex.

Esta actualización introduce un sistema de verificación de identidad de múltiples niveles:

  • Nivel básico: Verificación estándar, permite usar funciones comunes de ciberseguridad
  • Nivel avanzado: Verificación de identidad más estricta, desbloquea capacidades más potentes
  • Nivel superior: Nivel de verificación más alto, solo entonces permite el acceso a GPT-5.4-Cyber

El portal de registro individual está en chatgpt.com/cyber; los equipos empresariales pasan por el canal de ventas de OpenAI. Los miembros existentes de TAC pueden solicitar una actualización a niveles superiores por separado.

Anthropic vs OpenAI: Choque frontal de dos enfoques

El momento es demasiado oportuno para ser casualidad.

La semana pasada, Anthropic lanzó Mythos, enfatizando la elitización, pocos socios y resultados como prueba. La respuesta de OpenAI es un despliegue a gran escala, con miles de participantes, utilizando la cobertura para ganar.

Anthropic MythosOpenAI GPT-5.4-Cyber
Fecha de lanzamientoPrimera semana de abril de 202614 de abril de 2026
Alcance de usuarios objetivo~40 organizacionesMiles de individuos + cientos de equipos
Estrategia centralElitización, probar capacidad con resultadosDespliegue a gran escala, crear valor defensivo real
Capacidad emblemáticaDescubrir vulnerabilidad de 27 añosIngeniería inversa binaria, benchmark CTF 76 %

¿Cuál es más efectiva? Todavía no se puede decir. Pero el hecho de que ambas empresas compitan por el mismo circuito de IA para ciberseguridad en la misma ventana de tiempo ya muestra que esta dirección se considera un verdadero campo de batalla estratégico.

Otra frontera digna de mención

La relajación de GPT-5.4-Cyber tiene límites y se aplica solo a escenarios de seguridad defensiva. OpenAI exige controles de implementación más estrictos; se debe firmar un acuerdo antes de su uso.

Analizar la lógica C2 de malware: permitido. Usarlo para escribir nuevas herramientas de ataque: definitivamente no permitido.

Cómo se implementarán los límites específicos aún depende de la retroalimentación de la comunidad durante el uso real.

Fuente de referencia: OpenAI launches GPT-5.4-Cyber model for vetted security professionals (SiliconANGLE); CocoLoop, OpenAI Releases Cyber Model to Limited Group in Race With Mythos (Bloomberg)