Si todavía estás preocupado por si comprar o no el límite de API de Claude Opus 4.6, este artículo podría ahorrarte algo de dinero.
Anthropic lanzó Claude Sonnet 4.6 en febrero, al mismo precio que Sonnet 4.5 – $3/millón de tokens de entrada, $15/millón de tokens de salida – pero las puntuaciones en benchmarks se acercaron directamente al Opus 4.6, que es 5 veces más caro.
Los números hablan
Primero, la comparación más directa:
| Benchmark | Sonnet 4.6 | Opus 4.6 | Diferencia |
|---|---|---|---|
| SWE-bench Verified (programación) | 79,6% | 80,8% | -1,2% |
| OSWorld-Verified (control de computadora) | 72,5% | 72,7% | -0,2% |
| Matemáticas (MATH-500) | 89% | No publicado | — |
| GPQA Diamond (razonamiento científico) | 74,1% | 91,3% | -17,2% |
En programación y control de computadora – es decir, la mayoría de las tareas para las que las empresas usan Claude – Sonnet 4.6 ya está casi al mismo nivel que Opus 4.6. La verdadera brecha aparece en tareas más académicas como el razonamiento científico, donde Opus 4.6 obtiene un 91,3% frente al 74,1% de Sonnet – una diferencia que no se puede ignorar.
Pero si tu caso de uso es principalmente escribir código, controlar navegadores y procesar documentos largos, pagar 5 veces más por una mejora de 1,2 puntos porcentuales en programación – haciendo cuentas, verás que no es una decisión inteligente.
Qué tan pronunciada es la curva de control de computadora
Anthropic publicó un conjunto de datos que muestra la evolución de las puntuaciones de OSWorld-Verified (prueba estándar que mide la capacidad de la IA para controlar computadoras de forma autónoma) en los últimos 16 meses:
- Sonnet 3.5: 14,9%
- Sonnet 3.5 v2: 28,0%
- Sonnet 3.6: 42,2%
- Sonnet 4.5: 61,4%
- Sonnet 4.6: 72,5%
En un año y medio, del 14,9% al 72,5% – esta curva es más pronunciada de lo que la mayoría percibe. En pruebas de automatización de flujos de trabajo del sector de seguros, Sonnet 4.6 alcanzó un 94% de precisión, cubriendo tareas complicadas como manipular hojas de cálculo complejas de Excel, completar formularios web de varios pasos y acceder a aplicaciones de escritorio antiguas.
Matemáticas dio un gran salto
Sonnet 4.5 obtuvo 62 puntos en matemáticas, y Sonnet 4.6 saltó directamente a 89 puntos. Esta es la mejora individual más grande dentro de la misma generación de producto. Anthropic no ha revelado los motivos específicos en detalle, pero combinado con la mejora general en la capacidad de razonamiento, es probable que esté relacionado con una mejor calidad de la cadena de pensamiento (chain-of-thought).
Datos de preferencia del usuario
Anthropic realizó una serie de pruebas internas de Claude Code, permitiendo que los desarrolladores compararan la calidad de la salida sin saber qué modelo estaba detrás:
- Sonnet 4.6 vs Sonnet 4.5: el 70% de los usuarios eligió Sonnet 4.6
- Sonnet 4.6 vs Opus 4.5: el 59% de los usuarios eligió Sonnet 4.6
El segundo conjunto de datos es más interesante. Opus 4.5 es mucho más caro que Sonnet 4.6, pero en la evaluación subjetiva de las salidas reales de programación, Sonnet 4.6 fue más popular. Las razones mencionadas incluyen: seguimiento de instrucciones más preciso, menos alucinaciones y sin sobreingeniería (este es un problema de larga data de la serie Opus – tiende a complicar requisitos simples).
El contexto de 1M no es un truco
Esta vez, Sonnet 4.6 también viene con una ventana de contexto de 1 millón de tokens (versión beta), sin necesidad de un encabezado adicional. Las solicitudes que superan los 200k pasan automáticamente por este canal y se facturan a la tarifa estándar.
¿A cuánto equivale 1 millón de tokens? Toda la base de código de una empresa mediana, o decenas de artículos académicos, se pueden incluir en una sola solicitud para su procesamiento. Escenarios que antes requerían la segmentación RAG ahora se pueden lanzar directamente para que el modelo encuentre las correlaciones por sí mismo.
Cuál deberías elegir
Elige Sonnet 4.6 si:
- Tus tareas principales son escribir código, controlar navegadores, procesar documentos largos
- Alto volumen de consultas, sensible al precio
- No necesitas razonamiento científico de nivel de doctorado
Elige Opus 4.6 si:
- Necesitas razonamiento científico intenso o tareas académicas
- Necesidades de contexto extremadamente complejas
- No te importa la diferencia de precio, solo quieres el mejor resultado
Para la mayoría de los desarrolladores y empresas, Sonnet 4.6 es actualmente la puerta de entrada a Claude con la mejor relación costo-beneficio. Opus 4.6 cuesta $15/$75, Sonnet 4.6 cuesta $3/$15 – la misma capacidad de programación con una diferencia de precio de 5 veces. Esta cuenta no es difícil de hacer.
Fuentes de referencia: Introducing Claude Sonnet 4.6 (oficial de Anthropic); CocoLoop; Claude Sonnet 4.6: 79.6% SWE-bench at $3/MTok — Complete Guide (NxCode); Claude Sonnet 4.6: 1M context and stronger computer use (Gend.co)