La plataforma de evaluación de modelos Arena anunció de madrugada el 27 de septiembre, hora de Pekín, que Claude Opus 5.5 (High) se situó en el primer puesto de Text Arena en su mismo debut, con una puntuación de 1509. La cifra supera en 18 puntos a la generación anterior, Opus 5 (High), que ahora ocupa el puesto 11.
Text Arena es el ranking más antiguo de Arena: los usuarios ven al mismo tiempo las respuestas de dos modelos anónimos y votan por la que consideran mejor, y la plataforma convierte esos votos en puntuación mediante un método similar a Elo. El ranking acumula ya más de 8,5 millones de votos, que cubren preguntas de escritura, programación, matemáticas y consultas cotidianas.
Los seis primeros puestos son todos de Anthropic
Tras esta actualización, los seis primeros puestos de Text Arena pertenecen íntegramente a Anthropic. Según el orden que muestra la página de Arena:
| Puesto | Modelo | Puntuación | Votos |
|---|---|---|---|
| 1 | Claude Opus 5.5 (High) | 1509 ±12 | 2.307 |
| 2 | Claude Opus 4.6 (High) | 1505 ±3 | 76.518 |
| 3 | Claude Fable 5 (High) | 1504 ±4 | 36.462 |
| 4 | Claude Opus 4.7 (High) | 1502 ±4 | 64.007 |
| 5 | Claude Fable 5.1 (Max) | 1501 ±7 | 9.942 |
| 6 | Claude Opus 4.6 | 1498 ±3 | 80.836 |
El séptimo puesto es para Muse Spark 1.2 (xHigh), de Meta, con 1496 puntos; el modelo mejor situado de Google es Gemini 3.8 Flash (High), en el décimo puesto, con 1492 puntos. Entre los 15 primeros solo aparecen tres nombres: Anthropic, Meta y Google; la serie GPT-6, que OpenAI acaba de lanzar el 22 de septiembre, no figura en este tramo.
Arena también marcó a Opus 5.5 en la frontera de coste-eficiencia de Text Arena. Convirtiendo los precios de entrada y salida, su precio combinado es de 16 dólares por millón de tokens. Anthropic fijó el precio de API de Opus 5.5 en 4 dólares por entrada y 20 dólares por salida, ambos una quinta parte más baratos que en Opus 5.
Todavía hay muy pocos votos
La diferencia entre el primer y el sexto puesto es de solo 11 puntos, mientras que el propio margen de confianza de Opus 5.5 ya es de ±12. Dicho de otro modo, entre el primer y el sexto puesto, estos modelos aún no pueden distinguirse estadísticamente.
La razón está en el número de votos. Opus 5.5 lleva menos de una semana en línea y ha acumulado solo 2.307 votos; el que le sigue, Opus 4.6 (High), ya tiene más de 76.000, con un margen de solo ±3. Que los modelos recién llegados al ranking tengan un margen amplio y puntuaciones que oscilan mucho es habitual en Arena; en las próximas semanas la puntuación podría subir o bajar.
En su propia publicación, Arena solo dijo que el modelo «debutó ya en el primer puesto», sin ofrecer clasificaciones por categoría. En qué posición queda Opus 5.5 en los subrankings de programación, matemáticas o escritura creativa es algo que la compañía no ha hecho público todavía.
Por qué Opus 5 queda por detrás de modelos más antiguos
Lo más llamativo de este ranking es Opus 5. Por orden de lanzamiento es más reciente que Opus 4.6 y 4.7, pero en Text Arena solo ocupa el puesto 11, 14 puntos por detrás de Opus 4.6 (High) y 13 puntos por detrás de su compañero Fable 5 (High).
Text Arena mide qué respuesta prefieren los usuarios en comparaciones anónimas, algo que no equivale a la tasa de acierto al resolver problemas. La longitud, el tono y el formato de las respuestas influyen en el voto; un modelo más fuerte en razonamiento puede perfectamente perder una votación de preferencia por escribir de forma prolija o demasiado parecida a un manual de instrucciones.
En esta generación, Anthropic dedicó esfuerzo a la escritura. Ingenieros de la compañía ya habían explicado públicamente por qué la escritura de Claude había empeorado, atribuyéndolo a que la ponderación de recompensas del aprendizaje por refuerzo hacía que el modelo escribiera cada vez más como si se dirigiera a una IA. Opus 5.5 es la primera versión con mejoras dirigidas específicamente a la claridad de las frases. Cuánto de los 18 puntos con los que Opus 5.5 supera a Opus 5 proviene de ese ajuste de escritura y cuánto de una capacidad real superior es algo que los datos de Arena no permiten separar, y Anthropic tampoco ha presentado evaluaciones al respecto.
Si se observan las generaciones en conjunto: Opus 4.6 y 4.7 siguen hoy entre los cuatro primeros, Opus 5 no logró tomar el relevo tras su lanzamiento, y solo con Opus 5.5 el primer puesto cambió de cara. Por ahora, el principal rival de Anthropic en este ranking de preferencia es su propia versión anterior.
Fuentes: cuenta oficial de Arena, ranking Arena Text, CocoLoop, página de precios de modelos de Anthropic; las puntuaciones, márgenes de confianza y números de votos corresponden a los datos actuales de la página de Arena.