Claude Sonnet 5.5 llega un 30 % más rápido, sin subir el precio

Anthropic lanzó Claude Sonnet 5.5 el 28 de septiembre, el segundo modelo de la familia Claude 5.5 tras Opus 5.5. La empresa destaca dos cifras clave: una velocidad al menos un 30% superior a la de Sonnet 5, y un costo por tarea hasta un 30% menor en la mayoría de los trabajos. Los precios de la API no cambian: siguen siendo 2 dólares por millón de tokens de entrada, 10 dólares por los de salida y 0,2 dólares por lectura en caché.

El modelo está disponible desde el día del lanzamiento en la plataforma propia de Claude, AWS, Google Cloud y Microsoft Azure, con el nombre de API claude-sonnet-5-5, y la opción de retención cero de datos sigue disponible en todas las plataformas como de costumbre. El desarrollador independiente Simon Willison notó que el nivel gratuito de claude.ai ya utiliza Sonnet 5.5.

El balance oficial

Estos son los principales resultados que Anthropic incluyó en su página de lanzamiento:

Prueba de referenciaSonnet 5.5
Terminal-Bench 4.070,6%
OSWorld 2.1 (parcial)80,1%
Humanity's Last Exam (con herramientas)64,5%
CursorBench 4.055,5%
FrontierCode 1.1 (Max)46,2%
GDPval-AA v2.11844

Los comentarios de varios clientes que lo probaron de forma anticipada se centran en la velocidad. Box afirma que el nuevo modelo es 2,4 veces más rápido que la versión anterior, y Slack dice haber obtenido resultados mejores y más rápidos sin modificar sus prompts.

"Claude Sonnet 5.5 cooks. Fast at coding and can be steered quickly in iterative workflows."

Sonnet 5.5 programa rápido y basta una indicación para reencauzarlo durante la iteración, según Tyler Nishida, de Every.

La otra cara, según pruebas independientes

Artificial Analysis otorga a Sonnet 5.5 un índice de inteligencia de 56 puntos, en segundo lugar, solo 2 puntos por debajo de los 58 de Opus 5.5. En su propia prueba Terminal-Bench 4.0, Sonnet 5.5 obtiene 64%, frente al 60% de Opus 5.5 y GPT-6 Astra. Su punto débil está en las preguntas factuales: 54% de precisión factual frente al 66% de Opus 5.5, y también queda 6 puntos por debajo de Opus 5.5 en pruebas de razonamiento científico.

El apartado de costos no coincide con el discurso oficial. Al ejecutar todas las pruebas en el nivel de razonamiento máximo (max), Artificial Analysis mide que Sonnet 5.5 genera en promedio unos 193.000 tokens de salida por tarea, alrededor de un 60% más que Opus 5.5 y Sonnet 5 en su propio nivel max, y 7 veces más que GPT-6 Astra. Como el precio unitario no cambia pero los tokens aumentan, el costo por tarea se sitúa en torno a los 7,6 dólares, unos 50% más que Sonnet 5.

Los dos criterios de medición son distintos. Anthropic se refiere a "la mayoría de los trabajos", es decir, tareas cotidianas de codificación y escritura en el nivel predeterminado; Artificial Analysis prueba el escenario extremo con el presupuesto de razonamiento al máximo. Willison notó el mismo fenómeno: al pedirle al modelo que escribiera una pequeña aplicación WebGL en nivel max, consumió 128.000 tokens y 1,28 dólares; al cambiar a xhigh, el resultado llegó en 41 segundos y costó apenas unos 0,06 dólares. También señala que Sonnet 5.5 comparte un defecto con Opus 5.5: en el nivel max agota fácilmente su límite de tokens.

Comparado con modelos de su categoría

Vista en conjunto, la línea Sonnet tiene ahora un posicionamiento claro: ofrecer entre el 80% y el 90% de la capacidad de Opus a un precio menor. Cuando se lanzó, Sonnet 5 se promocionaba por costar apenas un tercio de Opus en tareas de agentes; con esta generación 5.5 la velocidad mejora y las puntuaciones de referencia se acercan aún más a Opus 5.5, con solo 2 puntos de diferencia en la clasificación de Artificial Analysis.

El cambio en el nivel gratuito tiene un impacto mayor. Según Willison, los usuarios gratuitos de claude.ai ahora reciben un modelo notablemente superior a la serie Luna que usa el nivel gratuito de ChatGPT. Por su parte, GPT-6 Luna de OpenAI apuesta por precios bajos: los datos más recientes de Arena muestran un costo por tarea de apenas unos 0,05 dólares. Anthropic aún no ha anunciado Haiku 5.5; Willison espera que llegue en las próximas semanas, momento en que la gama económica se enfrentará directamente a Luna.

Para los desarrolladores, la recomendación más directa es no apresurarse a activar el nivel max. Según los datos públicos actuales, los niveles predeterminado o xhigh se acercan más a la promesa oficial de "más rápido y más económico", mientras que la factura en nivel max puede resultar más cara que antes del cambio de generación. Anthropic no ha publicado una tabla de costos desglosada por nivel, así que para saber si conviene en una tarea concreta, hay que probarlo uno mismo.

Fuentes: página oficial de lanzamiento de Anthropic, blog de Simon Willison, CocoLoop, informe de evaluación de Artificial Analysis; los precios de la API corresponden a la página de lanzamiento de Anthropic, y el costo por tarea y el uso de tokens siguen el criterio del nivel max del índice de inteligencia de Artificial Analysis.