Sonnet 5.5 queda 3º y GPT-6.1 Sol 5º en Agent Arena

La plataforma de evaluación Arena añadió el 2 de octubre a Claude Sonnet 5.5 (nivel Max) y GPT-6.1 Sol (nivel Max) a la clasificación de Agent Arena. Los dos modelos quedaron en el tercer y quinto puesto, respectivamente, con tasas de mejora neta de 12,52% y 11,23%. Los dos primeros puestos siguen en manos de los propios modelos de Anthropic, Claude Fable 5.1 (14,31%) y Opus 5.5 (13,82%); el cuarto puesto es de GPT-6 Astra (12,27%).

Agent Arena puntúa de forma distinta a las arenas de texto habituales. Registra sesiones reales en las que los usuarios emplean el modelo como un agente: el modelo debe invocar herramientas, ejecutar tareas de varios pasos, y al final lo que cuenta es si el usuario quedó satisfecho. Según la página de la clasificación, se han acumulado ya unas 2,158 millones de sesiones, repartidas entre 51 modelos. La tasa de mejora neta combina la fiabilidad al invocar herramientas, la finalización de tareas y la «steerability» (capacidad de guiarse); el 30 de septiembre Arena actualizó el algoritmo de steerability, que antes evaluaba únicamente «si, tras una corrección, el modelo había cambiado o no», y ahora evalúa cada respuesta valorable dentro de la conversación, de modo que los modelos que aciertan a la primera obtienen puntos extra.

Tercero y quinto: la diferencia cabe en el margen de error

Si se mira solo la posición, Sonnet 5.5 superó a GPT-6 Astra y a GPT-6.1 Sol. Pero al incluir el margen de error el panorama cambia: la puntuación de Sonnet 5.5 es 12,52% ± 3,09%, y la de GPT-6.1 Sol, 11,23% ± 2,76%; ambos rangos se solapan en gran parte y quedan a solo 0,25 puntos porcentuales del cuarto puesto, Astra. Como los modelos nuevos acaban de entrar en la clasificación, la muestra de sesiones todavía es pequeña, y el margen de error es mucho más amplio que el de Opus 5.5 (± 2,17%). Con los datos actuales, es difícil afirmar con certeza quién, entre el tercero y el quinto puesto, es realmente más fuerte.

En las categorías específicas, cada uno tiene sus puntos fuertes. Sonnet 5.5 encabeza la categoría de recuperación tras fallos de comandos Bash, con 15,05%; GPT-6.1 Sol encabeza la de alucinación de herramientas, con solo un 0,49% de tasa de invención de herramientas inexistentes, y queda segundo en «confirmación de finalización de tarea por el usuario» con 15,47%.

La factura es lo que marca la diferencia

Los precios de API de ambos modelos son, de hecho, iguales: 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida. Pero en tareas de tipo agente, el coste por tarea llega a diferir varias veces. La página de costes de Arena muestra:

ModeloTasa de mejora netaCoste por tarea
Claude Fable 5.114,31%unos 4,91 dólares
Claude Opus 5.513,82%unos 1,56 dólares
Claude Sonnet 5.512,52%unos 2,99 dólares
GPT-6 Astra12,27%unos 3,10 dólares
GPT-6.1 Sol11,23%unos 0,58 dólares
DeepSeek V4.1 Flash4,02%unos 0,11 dólares

Mismo precio por token, pero un coste por tarea unas cinco veces distinto: la diferencia está en el consumo de tokens. En el nivel Max, Sonnet 5.5 tiende a escribir respuestas más largas y a «pensar» durante más tiempo; evaluaciones independientes anteriores ya habían detectado que consume bastantes más tokens por tarea que la generación anterior. El resultado es que puntúa más bajo y cuesta más que su propio Opus 5.5, un modelo mayor dentro de la familia Claude, y no entra en la frontera de eficiencia de costes (frontera de Pareto) que marca Arena. Esa frontera está formada ahora por cuatro puntos: Fable 5.1, Opus 5.5, GPT-6.1 Sol y DeepSeek V4.1 Flash.

GPT-6.1 Sol es el que ha redibujado esta vez la frontera. Según la comparación que dio Arena al anunciarlo: su coste mediano por tarea es un 39% más bajo que el de la versión anterior, GPT-6 Sol, con una puntuación 1,52 puntos porcentuales más alta; frente a GPT-6 Astra es un 81% más barato, con una diferencia de puntuación de hasta 1,04 puntos porcentuales. GPT-6.1 Sol sustituyó a GPT-6 Sol poco más de una semana después de su lanzamiento, y esta clasificación le da a OpenAI una validación de un tercero de que es posible ser «más barato sin perder puntos».

Estas cifras de coste también tienen límites metodológicos. Arena contabiliza sesiones que los propios usuarios inician en su plataforma, y los tipos de tarea son principalmente escribir código, buscar información y ejecutar comandos; esa distribución no tiene por qué coincidir con los flujos de trabajo reales dentro de una empresa. Los costes se calculan según lo que Arena paga realmente por las llamadas a la API, y las facturas empresariales que usan descuentos de caché o por volumen pueden salir más bajas. Si se usa esta tabla para decisiones de compra, conviene antes volver a probarlo con una muestra de las propias tareas.

Comparado con la generación anterior

Mirando hacia atrás, la línea Sonnet lleva avanzando de forma constante en Agent Arena. La generación anterior, Sonnet 5, quedó sexta en su primera aparición; esta vez, 5.5 entra en el top 3. Del lado de OpenAI el ritmo es distinto: GPT-6 Sol entró en la clasificación el 25 de septiembre con una tasa de mejora neta de 9,71%; una semana después llegó 6.1 Sol, con una puntuación cerca de un punto y medio más alta y un coste alrededor de un 40% más bajo.

Para los desarrolladores, qué modelo usar para tareas de agente depende del volumen de trabajo. Para quien ejecuta solo algunas tareas complejas de forma ocasional, un modelo con puntuación alta y precio no demasiado elevado, como Opus 5.5, resulta más tranquilo; para quien necesita ejecutar en gran volumen y pagar por uso, opciones de bajo coste como GPT-6.1 Sol o DeepSeek V4.1 Flash son más adecuadas. En cuanto a Sonnet 5.5, dónde quedaría en coste y puntuación con un nivel de razonamiento más bajo es algo que aún no se sabe: Arena solo ha probado, por ahora, el nivel Max.

Fuentes: clasificación de Agent Arena de Arena, página de frontera de costes de Arena, CocoLoop, cuenta oficial de Arena, Artificial Analysis; las tasas de mejora neta, los márgenes de error y los costes por tarea de cada modelo corresponden a los valores mostrados en la página de Arena.