Claude Opus 4.7 se lanza con capacidad de código 3 veces superior

Anthropic lanzó Claude Opus 4.7 el 16 de abril. Las mejoras en la capacidad de programación de esta versión sorprendieron a muchos: las tareas de corrección de código en producción alcanzaron el triple de la generación anterior, y SWE-bench Pro saltó de 53,4% a 64,3%.

Tres benchmarks más destacados

Primero, los datos principales:

Benchmark Opus 4.6 Opus 4.7 Cambio
SWE-bench Pro 53,4% 64,3% +10,9%
CursorBench 58% 70% +12%
Rakuten-SWE-Bench (tareas de producción) Línea base 3 veces Mejora significativa

SWE-bench Pro es actualmente reconocido como un benchmark de programación difícil de superar. El 64,3% ya supera a GPT-5.4, lanzado en marzo, y a Gemini 3.1 Pro de Google, lanzado en febrero. En las pruebas internas de Anthropic con 93 tareas de programación, Opus 4.7 mejoró un 13% respecto a Opus 4.6 y resolvió 4 problemas adicionales que Opus 4.6 no podía resolver.

El número de Rakuten es el más interesante: "las tareas de corrección de código en producción son tres veces las de la generación anterior" se refiere a la corrección de errores en bases de código empresariales reales, no en conjuntos de datos sintéticos. Los números obtenidos con código real en producción tienen más valor de referencia que los problemas sintéticos de laboratorio.

Anthropic también realizó su propia Evaluación de Agente Financiero (Finance Agent Evaluation) y el benchmark de valor económico del conocimiento (GDPval-AA), ambos alcanzando los mejores resultados actuales.

Capacidad visual más que triplicada, pero poco mencionada

Además de la programación, Opus 4.7 recibió mejoras significativas en el procesamiento de imágenes:

  • Soporta lado largo máximo de 2576 píxeles (aproximadamente 3,75 megapíxeles)
  • Más de 3 veces el límite de resolución de imagen anterior de la serie Claude
  • Reconocimiento significativamente más preciso de diagramas de estructura molecular química y dibujos técnicos complejos

Esto tendrá un gran impacto en escenarios de investigación científica, análisis de documentos técnicos o lectura de planos de ingeniería. Para escribir código, el impacto puede no ser tan directo, pero las personas que trabajan en el área multimodal deberían probarlo.

También hay un cambio fácil de pasar por alto: el tokenizador se ha actualizado, y la misma entrada de texto ahora genera de 1,0 a 1,35 veces la cantidad de tokens. Suena como algo malo (más tokens significan más caro), pero en realidad indica que el modelo procesa información con una granularidad más fina, lo que debería mejorar la comprensión de documentos largos y código complejo.

Por qué Anthropic desactivó deliberadamente las capacidades de ciberseguridad

Esta es la decisión más contraintuitiva del lanzamiento de 4.7: Opus 4.7 añade proactivamente barreras de seguridad, detectando y bloqueando automáticamente solicitudes de ciberseguridad de alto riesgo.

Un momento — Anthropic acaba de lanzar Claude Mythos Preview la semana pasada, centrado en ciberseguridad, y se asoció con Amazon, Apple y Microsoft para lanzar el proyecto especial Project Glasswing. ¿Cómo pueden coexistir ambas cosas?

La respuesta es segmentación de producto:

  • Mythos es un modelo controlado diseñado específicamente para profesionales de seguridad, accesible solo después de la verificación de identidad a través del Programa de Verificación Cibernética (Cyber Verification Program)
  • Opus 4.7 es el buque insignia general para el público; Anthropic no quiere que se convierta en una herramienta de ataque que cualquiera pueda invocar

La lógica tiene sentido. Concentrar capacidades de alto riesgo en canales profesionales verificables, en lugar de abrirlas a todos a través de la API — esta es una segmentación de seguridad pragmática.

Resumen de nuevas funciones

Varias funciones auxiliares se lanzaron simultáneamente:

  • Task budgets (prueba pública): Permite a Claude gestionar su propio consumo de tokens en tareas de larga duración, evitando que el presupuesto se agote repentinamente en la fase final
  • Comando /ultrareview: Sesión de revisión de código especializada, señalando errores y problemas de diseño, más profunda que una revisión normal
  • Nivel de esfuerzo xhigh: Anteriormente solo high, ahora se añade xhigh, ofreciendo un ajuste más fino entre la profundidad de razonamiento y la velocidad de respuesta
  • Modo Auto expandido: Disponible para usuarios de Max Claude Code

Los precios no cambian: llamadas de API a $5/millón de tokens de entrada, $25/millón de tokens de salida, exactamente igual que Opus 4.6. Soporte de plataforma: claude.ai, API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry ya están disponibles, con el ID del modelo claude-opus-4-7.

Qué tan grande es realmente la brecha con la competencia

Según Anthropic, Opus 4.7 supera a GPT-5.4 (lanzado en marzo) y a Gemini 3.1 Pro (lanzado en febrero) en programación agentiva, llamada de herramientas a gran escala, uso agentivo de computadora y análisis financiero.

Por supuesto, los benchmarks son solo benchmarks. La diferencia en la experiencia real solo será evidente cuando la comunidad comience a usar el modelo. Pero solo el número "3 veces" de Rakuten-SWE-Bench ya es lo suficientemente convincente en el escenario de corrección de código en producción.

De Opus 4.6 a 4.7, no es una iteración superficial — al menos en tareas de programación, la magnitud de la mejora esta vez merece una consideración seria.

Fuentes de referencia: CocoLoop, Introducing Claude Opus 4.7 (Anthropic Blog); Anthropic's Claude Opus 4.7 makes a big leap in coding, while deliberately scaling back cyber capabilities (The Decoder); Anthropic releases Claude Opus 4.7, narrowly retaking lead for most powerful generally available LLM (VentureBeat)