Pontuação CTF do GPT-5.4-Cyber salta de 27% para 76%

Na semana passada, a Anthropic lançou o Mythos, afirmando que o disponibilizaria para apenas 40 organizações, ajudando algumas equipes a descobrir vulnerabilidades de 27 anos. Esta semana, a OpenAI responde diretamente: o GPT-5.4-Cyber chega, visando milhares de pesquisadores de segurança e centenas de equipes, superando em escala a abordagem de clube de elite do Mythos.

As duas empresas, na mesma janela de tempo, usam duas estratégias completamente diferentes para competir na mesma pista.

O que é o GPT-5.4-Cyber?

Não se trata de um modelo totalmente novo, mas de uma variante especializada em segurança cibernética do GPT-5.4. A diferença central é o afrouxamento direcionado das restrições para cenários de segurança defensiva.

A capacidade nova mais importante: engenharia reversa binária (binary reverse engineering).

A análise de segurança comum geralmente exige acesso ao código-fonte ou desmontagem manual. O GPT-5.4-Cyber pode receber diretamente arquivos binários compilados, ajudando a encontrar vulnerabilidades e identificar lógica maliciosa. Na prática, apenas uma minoria de malwares tem código-fonte disponível — a maior parte das análises de ataques APT, engenharia reversa de ransomware e verificações de segurança de cadeia de suprimentos lida com caixas-pretas compiladas. Esse recurso atinge diretamente os cenários mais desafiadores para engenheiros de segurança.

De 27% a 76%: O que esses números significam?

A OpenAI usa o benchmark CTF (Capture The Flag) para medir o progresso das capacidades de segurança:

PeríodoModeloPontuação no benchmark CTF
Agosto de 2025GPT-527%
Novembro de 2025GPT-5.1-Codex-Max76%

De 27% para 76% em três meses — isso significa que a capacidade prática de resolução de problemas da IA em segurança cibernética quase triplicou. Há um ano, a IA só conseguia responder perguntas básicas de segurança; agora, resolve a maioria dos problemas CTF de dificuldade média.

Simultaneamente, a ferramenta de análise de segurança de código Codex Security, baseada no GPT-5.4-Cyber, desde seus testes internos já ajudou a corrigir mais de 3.000 vulnerabilidades de alto risco ou críticas.

Programa TAC: Acesso em níveis, não para qualquer um

O canal de acesso ao GPT-5.4-Cyber é o programa Trusted Access for Cyber (TAC), lançado em fevereiro junto com uma doação de US$ 10 milhões para segurança cibernética, na época rodando no GPT-5.3-Codex.

Esta atualização introduz um sistema de verificação de identidade em múltiplas camadas:

  • Camada básica: Verificação padrão, permite usar funções comuns de segurança cibernética
  • Camada avançada: Verificação de identidade mais rigorosa, desbloqueia capacidades mais fortes
  • Camada superior: Nível mais alto de verificação, só então permite acesso ao GPT-5.4-Cyber

O portal de registro individual está em chatgpt.com/cyber; equipes empresariais passam pelo canal de vendas da OpenAI. Membros existentes do TAC podem solicitar upgrade para níveis mais altos separadamente.

Anthropic vs OpenAI: Confronto frontal de duas abordagens

O momento é muito oportuno para ser coincidência.

Na semana passada, a Anthropic lançou o Mythos, enfatizando elitização, poucos parceiros e resultados como prova. A resposta da OpenAI é uma implantação em larga escala, com milhares de participantes, usando cobertura para vencer.

Anthropic MythosOpenAI GPT-5.4-Cyber
Data de lançamentoPrimeira semana de abril de 202614 de abril de 2026
Escopo de usuários-alvo~40 organizaçõesMilhares de indivíduos + centenas de equipes
Estratégia centralElitização, provar capacidade com resultadosImplantação em larga escala, criar valor defensivo real
Capacidade emblemáticaDescobrir vulnerabilidade de 27 anosEngenharia reversa binária, benchmark CTF 76%

Qual é mais eficaz? Ainda não é possível dizer. Mas o fato de ambas as empresas disputarem a mesma pista de IA para segurança cibernética na mesma janela de tempo já mostra que essa direção é tratada como um verdadeiro campo de batalha estratégico.

Outra fronteira digna de nota

O afrouxamento do GPT-5.4-Cyber tem limites, aplicando-se apenas a cenários de segurança defensiva. A OpenAI exige controles de implantação mais rigorosos; é necessário assinar um acordo antes do uso.

Analisar a lógica C2 de malware: permitido. Usar para escrever novas ferramentas de ataque: definitivamente não permitido.

Como os limites específicos serão implementados, ainda depende do feedback da comunidade durante o uso real.

Fonte de referência: OpenAI launches GPT-5.4-Cyber model for vetted security professionals (SiliconANGLE); CocoLoop, OpenAI Releases Cyber Model to Limited Group in Race With Mythos (Bloomberg)