Anthropic presentó el 22 de septiembre Claude Opus 5.5, el primer modelo de la serie Claude 5.5. Su posicionamiento oficial se resume en dos ideas: el rendimiento en la mayoría de tareas es comparable al de Claude Fable 5.1, y el coste operativo general es un 40 % menor que el de Opus 5.
Desglosando la tabla de precios, la entrada cuesta 4 dólares por millón de tokens y la salida 20 dólares, ambos con una rebaja del 20 %; la lectura de caché baja de 0,50 a 0,20 dólares, un recorte del 60 %. En cuanto a velocidad de salida, Anthropic afirma que es más de un 30 % superior a la de Opus 5, y además hay un modo rápido a 8 y 40 dólares con hasta 2,5 veces más velocidad. El modelo está disponible en la API de la plataforma Claude (con el ID claude-opus-5-5), en AWS, Google Cloud y Microsoft Azure, y de forma simultánea en las plataformas de consumo; la salida máxima por solicitud es de 128.000 tokens.
Resultados de benchmarks
La página oficial de lanzamiento ofrece la siguiente comparativa.
| Benchmark | Opus 5.5 | Fable 5.1 | Opus 5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% |
| GDPval-AA v2.1 | 1846 Elo | 1735 | 1708 |
| OSWorld 2.0 | 81.8% | 80.7% | 74.0% |
Artificial Analysis, firma independiente de evaluación, sitúa a Opus 5.5 en primer lugar de su índice de inteligencia, con 58 puntos. Ese mismo día se lanzó Claude Code 2.1.280, que ya establece a Opus 5.5 como el modelo Opus predeterminado.
La página de lanzamiento también cita comentarios de varios clientes que probaron el modelo: GitHub afirma que, para resolver las mismas tareas de terminal, necesita menos de la mitad de los pasos que con Opus 5; Optiver dice que la calidad es comparable a la de Opus 5 con aproximadamente la mitad de rondas, y un coste entre un 40 % y un 50 % menor; Deloitte señala que, en el nivel de razonamiento más bajo, detecta el 72 % de los defectos conocidos, frente al 56 % de Opus 5 en su nivel más alto. Todas estas cifras proceden de declaraciones de clientes recogidas por el propio fabricante en su página de lanzamiento, sin verificación independiente de terceros.
Lo que dice Anthropic sobre seguridad
Anthropic afirma que Opus 5.5 superó una auditoría automatizada de comportamiento, con la puntuación de alineación más alta hasta la fecha, y que los intentos de sortear los límites del sandbox cayeron un 85 % respecto a Opus 5. La mayoría de las tareas de ciberseguridad se siguen enrutando a Opus 4.8, y el nivel de protección en el ámbito biológico se mantiene igual que en Claude Fable 5.1. El modelo conserva las protecciones contra la destilación del proceso de razonamiento, incorpora marca de agua conforme a la Ley de IA de la UE, y las empresas pueden optar por la retención cero de datos. Antes del lanzamiento, METR y Frontier Design participaron en la evaluación.
Las tasas concretas de fallo, de negativa a responder y las entradas del equipo de red-team habrá que verificarlas cuando se publique la ficha de sistema completa; la propia página oficial no incluye estas cifras.
En el contexto de la lista de precios del mismo día
El 22 de septiembre, OpenAI también lanzó GPT-6 Sol y Luna, con precios de API que se reducen a la mitad respecto a la generación anterior: Sol cuesta 2 y 10 dólares, y Luna 0,10 y 0,50 dólares. En comparación, el precio unitario de Opus 5.5 sigue siendo el doble que el de Sol; lo que vende Anthropic en ese mismo segmento es puntuación y menos pasos: según Optiver y GitHub, al reducirse el número de rondas por tarea, la diferencia de precio unitario se compensa en parte en la factura. Cuánto se compensa depende de la naturaleza concreta de la tarea, sin una respuesta universal.
Por el lado de los desarrolladores ya ha surgido una prueba con resultado contrario. El bloguero tecnológico Simon Willison probó a pedirle a Opus 5.5, en el nivel de razonamiento más alto, que generara un SVG complejo, y el modelo agotó los 128.000 tokens de salida sin completar la tarea. Un nivel de razonamiento alto combinado con salidas largas puede consumir fácilmente todo el presupuesto de salida; antes de integrarlo en un flujo automatizado conviene tener en cuenta este límite.
Para los equipos que ya usan Opus 5, el coste de cambio se concentra principalmente en dos puntos: hay que actualizar el ID del modelo, y los cambios en velocidad de salida y número de rondas hacen que los parámetros de tiempo de espera y reintentos dejen de ser adecuados. La bajada de precio se nota más en escenarios de llamadas frecuentes, especialmente con ese 60 % de descuento en la lectura de caché: cuanto más largo el system prompt permanente y más densas las solicitudes, mayor el porcentaje de ahorro.
Fuentes: página oficial de lanzamiento de Anthropic, Artificial Analysis, CocoLoop, blog de Simon Willison; la página oficial de lanzamiento es la referencia para los precios de cada nivel, los benchmarks y las medidas de seguridad.