Anthropic a publié Claude Opus 4.7 le 16 avril. Les améliorations des capacités de programmation de cette version ont surpris beaucoup de monde — les tâches de correction de code en production ont atteint trois fois celles de la génération précédente, et le SWE-bench Pro est passé de 53,4 % à 64,3 %.
Trois benchmarks les plus remarquables
Commençons par les données clés :
| Benchmark | Opus 4.6 | Opus 4.7 | Évolution |
|---|---|---|---|
| SWE-bench Pro | 53,4 % | 64,3 % | +10,9 % |
| CursorBench | 58 % | 70 % | +12 % |
| Rakuten-SWE-Bench (tâches de production) | Référence | 3 fois | Amélioration significative |
SWE-bench Pro est aujourd'hui reconnu comme un benchmark de programmation difficile à atteindre. Les 64,3 % dépassent déjà GPT-5.4, publié en mars, et Gemini 3.1 Pro de Google, publié en février. Dans les tests internes d'Anthropic portant sur 93 tâches de programmation, Opus 4.7 s'est amélioré de 13 % par rapport à Opus 4.6 et a résolu 4 problèmes supplémentaires qu'Opus 4.6 ne pouvait pas du tout résoudre.
Le chiffre de Rakuten est le plus intéressant — « les tâches de correction de code en production sont trois fois supérieures à celles de la génération précédente » fait référence à la correction de bugs dans des bases de code d'entreprise réelles, et non à des ensembles de données synthétiques. Les chiffres obtenus avec du code réel en production ont plus de valeur de référence que les problèmes synthétiques de laboratoire.
Anthropic a également réalisé sa propre évaluation d'agent financier (Finance Agent Evaluation) et le benchmark de valeur économique des connaissances (GDPval-AA), tous deux obtenant les meilleurs résultats actuels.
Capacité visuelle plus que triplée, mais rarement mentionnée
Outre la programmation, Opus 4.7 a reçu des améliorations significatives dans le traitement d'images :
- Prend en charge un côté long maximal de 2576 pixels (environ 3,75 mégapixels)
- Plus de 3 fois la limite de résolution d'image précédente de la série Claude
- Reconnaissance nettement plus précise des diagrammes de structure moléculaire chimique et des dessins techniques complexes
Cela aura un impact important sur les scénarios de recherche scientifique, l'analyse de documents techniques ou la lecture de plans d'ingénierie. Pour l'écriture de code, l'impact peut être moins direct, mais les personnes travaillant dans le domaine multimodal devraient tester.
Il y a aussi un changement facile à négliger : le tokenizer a été mis à jour, et la même entrée de texte génère désormais 1,0 à 1,35 fois la quantité de tokens. Cela semble être une mauvaise chose (plus de tokens signifie plus cher), mais cela indique en réalité que le modèle traite les informations avec une granularité plus fine, ce qui devrait améliorer la compréhension des documents longs et du code complexe.
Pourquoi Anthropic a délibérément désactivé les capacités de cybersécurité
C'est la décision la plus contre-intuitive de la version 4.7 : Opus 4.7 ajoute proactivement des barrières de sécurité, détectant et bloquant automatiquement les demandes de cybersécurité à haut risque.
Attendez — Anthropic vient de publier Claude Mythos Preview la semaine dernière, axé sur la cybersécurité, et s'est associé à Amazon, Apple et Microsoft pour lancer le projet spécial Project Glasswing. Comment ces deux choses peuvent-elles coexister ?
La réponse est la segmentation des produits :
- Mythos est un modèle contrôlé conçu spécifiquement pour les professionnels de la sécurité, accessible uniquement après vérification d'identité via le Programme de vérification cybernétique (Cyber Verification Program)
- Opus 4.7 est le modèle phare général destiné au public ; Anthropic ne souhaite pas qu'il devienne un outil d'attaque que n'importe qui peut invoquer
La logique est cohérente. Concentrer les capacités à haut risque dans des canaux professionnels vérifiables, plutôt que de les ouvrir à tous via l'API — c'est une segmentation de sécurité pragmatique.
Aperçu des nouvelles fonctionnalités
Plusieurs fonctionnalités auxiliaires ont été lancées simultanément :
- Task budgets (test public) : Permet à Claude de gérer lui-même sa consommation de tokens lors de tâches de longue durée, évitant une rupture soudaine de budget en phase finale
- Commande /ultrareview : Session de révision de code spécialisée, signalant les bugs et les problèmes de conception, plus approfondie qu'une révision normale
- Niveau d'effort xhigh : Auparavant seulement high, maintenant xhigh s'ajoute, offrant un réglage plus fin entre la profondeur de raisonnement et la vitesse de réponse
- Mode Auto étendu : Disponible pour les utilisateurs de Max Claude Code
Les prix restent inchangés : appels API à 5 $/million de tokens d'entrée, 25 $/million de tokens de sortie, exactement comme Opus 4.6. Support de plateforme : claude.ai, API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry sont tous disponibles, avec l'ID de modèle claude-opus-4-7.
Quel est l'écart réel avec les concurrents
Selon Anthropic, Opus 4.7 surpasse GPT-5.4 (publié en mars) et Gemini 3.1 Pro (publié en février) en programmation agentive, appel d'outils à grande échelle, utilisation agentive d'ordinateur et analyse financière.
Bien sûr, les benchmarks ne sont que des benchmarks. La différence dans l'expérience réelle ne sera évidente que lorsque la communauté commencera à utiliser le modèle. Mais le simple chiffre « 3 fois » du Rakuten-SWE-Bench est déjà suffisamment convaincant dans le scénario de correction de code en production.
D'Opus 4.6 à 4.7, ce n'est pas une itération superficielle — du moins dans les tâches de programmation, l'ampleur de l'amélioration cette fois mérite une attention sérieuse.
Sources de référence : CocoLoop, Introducing Claude Opus 4.7 (Anthropic Blog) ; Anthropic's Claude Opus 4.7 makes a big leap in coding, while deliberately scaling back cyber capabilities (The Decoder) ; Anthropic releases Claude Opus 4.7, narrowly retaking lead for most powerful generally available LLM (VentureBeat)