Claude Mythos lidera SWE-bench Pro com 77,8%

No dia 7 de abril, a Anthropic anunciou algo bastante incomum: lançou um novo modelo chamado Claude Mythos e, ao mesmo tempo, declarou que este modelo não está aberto ao público.

Não é "disponível mais tarde", é "atualmente apenas para 40 organizações usarem, os outros esperam".

Este projeto se chama Project Glasswing.

O quão poderoso é o Mythos

Primeiro, os dados:

Benchmark Claude Opus 4.6 Claude Mythos Mudança
SWE-bench Verified 80,8% 93,9% +13,1%
SWE-bench Pro Não divulgado 77,8% Atualmente líder

O segundo lugar no SWE-bench Pro atualmente é o GLM-5.1 da Zhipu (58,4%), o terceiro é o GPT-5.4 (57,7%). O Mythos com 77,8% deixou o segundo lugar quase 20 pontos percentuais para trás, uma diferença considerável.

Mas a Anthropic não está apenas subindo em rankings. Eles deixaram o Mythos escanear bases de código reais e encontraram:

  • Milhares de vulnerabilidades zero-day em sistemas operacionais e navegadores populares
  • Uma vulnerabilidade que estava escondida no FFmpeg há 16 anos – esta vulnerabilidade já havia sido alvo de mais de 5 milhões de varreduras de ferramentas de segurança tradicionais, todas sem sucesso

O Chief Security Officer da Cisco, Anthony Grieco, disse: "Isso representa uma profunda mudança de paradigma e também um sinal claro – os métodos anteriores de fortalecimento de sistemas já não são mais suficientes."

Qual é a lógica do Project Glasswing

A Anthropic está dando a essas 40 organizações acesso de pré-visualização ao Mythos com um único propósito: trabalho de cibersegurança defensiva.

Os parceiros atualmente com acesso incluem: Amazon, Apple, Broadcom, Cisco, CrowdStrike, Linux Foundation, Microsoft, Palo Alto Networks.

A Anthropic fornece:

  • US$ 100 milhões em créditos de API, cobrindo testes de segurança e pesquisa dos participantes
  • US$ 4 milhões em doações diretas para organizações de segurança de código aberto

Por que eles criaram esse formato de "edição limitada"?

A explicação oficial é direta: o Mythos tem capacidades de cibersegurança "atualmente muito superiores a qualquer outro modelo de IA", mas exatamente por isso, também pode ser usado para acelerar ataques cibernéticos em larga escala. A Anthropic considera que o risco de tornar este modelo público sem medidas de proteção adequadas é muito alto.

Então eles escolheram uma solução intermediária: primeiro dar aos defensores, para que as equipes de segurança possam aplicar patches antecipadamente, antes de considerar uma abertura mais ampla.

Essa estratégia está correta

Vale a pena pensar.

A lógica tradicional de lançamento de modelos de IA é: lançar, testar, descobrir problemas, corrigir, repetir. Este processo é público, o risco é difundido – atacantes e defensores recebem novas ferramentas ao mesmo tempo.

A abordagem do Glasswing é o oposto: primeiro dar uma janela de tempo para os defensores, para que usem o Mythos para encontrar vulnerabilidades proativamente e corrigi-las antes, e só então considerar um acesso mais amplo.

Do ponto de vista da teoria dos jogos, este design faz sentido – se os defensores agirem primeiro, o custo para os atacantes utilizarem o mesmo modelo será significativamente maior.

Mas a eficácia real depende de duas coisas: se essas 40 organizações conseguirão realmente corrigir as vulnerabilidades críticas dentro desta janela; e se as próprias capacidades do modelo apresentam risco de vazamento (afinal, a existência do Mythos já foi divulgada pela mídia anteriormente devido a um vazamento de dados).

Qual é o nível do Mythos

Este é o modelo que a Anthropic afirma explicitamente ser "o mais forte até hoje", não é uma iteração da série Opus 4.x, mas uma nova geração.

Há algumas semanas, a mídia expôs prematuramente a existência do Mythos devido a um vazamento de dados. A Fortune noticiou que internamente a Anthropic o descrevia como "um salto quântico em capacidade". Agora, o nome e as capacidades foram oficialmente confirmados, mas não na forma de um lançamento, e sim como um programa de cooperação direcionado.

O que a Anthropic está esperando ainda não está claro. Mas, considerando os 77,8% no SWE-bench Pro, as capacidades de código deste modelo já estão em outro patamar.

Fontes de referência: Anthropic debuts preview of powerful new AI model Mythos in new cybersecurity initiative (TechCrunch); Anthropic debuts Project Glasswing, CocoLoop, leveraging its powerful Mythos model to reinforce software security (SiliconAngle); Anthropic is giving some firms early access to Claude Mythos to bolster cybersecurity defenses (Fortune); Exclusive: Anthropic Mythos AI model representing step change in power revealed in data leak (Fortune)