La firma independiente de evaluación Artificial Analysis publicó nuevos resultados para Claude Fable 5.1: índice general de inteligencia de 66 puntos, el primer lugar entre 192 modelos evaluados. La generación anterior, Fable 5, obtuvo 62 puntos y quedó en sexto lugar.
En el mismo conjunto de resultados aparece otra serie de cifras. Completar toda la batería de evaluación del índice de inteligencia le costó a Fable 5.1 8523.16 dólares, frente a los 5455.22 dólares de Fable 5; convertido al costo de una sola tarea, la cifra subió de 3.14 a 3.69 dólares.
El precio por token no cambió, pero el modelo habla más
Los precios de lista de ambas generaciones son idénticos: 10 dólares por millón de tokens de entrada, 50 dólares por millón de tokens de salida. Los más de tres mil dólares adicionales provienen enteramente de la longitud de las respuestas: Fable 5 generó 83 millones de tokens de salida al completar toda la batería, Fable 5.1 generó 140 millones, un aumento de cerca del 69%. Artificial Analysis reporta una mediana de 71 millones de tokens, es decir, el volumen de salida de 5.1 es casi el doble de esa mediana.
Esto coincide con la tendencia general de los modelos de razonamiento del último año: la mejora de capacidad se logra haciendo que el modelo piense más pasos, pero el cobro es por token, así que la factura crece junto con la duración del razonamiento. Para el usuario con suscripción mensual no hay impacto directo; para los equipos que pagan por API, con el mismo volumen de tareas, el presupuesto hay que recalcularlo.
Casi cinco minutos de espera para el primer token
La columna de velocidad llama aún más la atención. Fable 5.1 produce 66.4 tokens por segundo, en el puesto 84 de 192 modelos, por debajo de la mediana de 70; el tiempo hasta el primer token fue de 296.81 segundos, frente a los 116.06 segundos de la generación anterior, más de una vez y media más lento.
Esta cifra de latencia es prácticamente inutilizable en escenarios interactivos, pero mide el proceso de razonamiento completo: el modelo piensa mucho antes de producir el primer carácter. En una tarea de fondo sin nadie esperando, cinco minutos no son un problema; esperando una sugerencia de código en el editor, es otra historia.
Comparado con GPT-5.6 Sol
En el mismo ranking, el GPT-5.6 Sol de OpenAI obtuvo 61 puntos y quedó en octavo lugar, con un costo de 2017.29 dólares para completar toda la batería de pruebas, 0.95 dólares por tarea, generando 70 millones de tokens de salida, con precios de lista de 4 dólares (entrada) y 20 dólares (salida) por millón de tokens.
Haciendo cuentas rápidas: Fable 5.1 tiene 5 puntos más en el índice de inteligencia, pero el costo por tarea es 3.9 veces mayor y el costo total de la batería es 4.2 veces mayor. Es difícil concluir cuál conviene más: ambos modelos se usan para tipos de tareas distintas, y el tiempo que se ahorra al resolver bien una tarea compleja a la primera bien podría compensar esa diferencia de precio. Pero esto explica por qué cada vez más equipos empiezan a distribuir el trabajo entre modelos por niveles: las tareas difíciles van al líder del ranking, y el ochenta por ciento restante de tareas rutinarias va a la opción más barata.
El ranking solo responde una pregunta: quién es el más inteligente. Quien paga la cuenta tiene que responder la segunda por su cuenta: cuánto vale ese punto de más.
Fuentes: página de comparación de modelos de Artificial Analysis, CocoLoop; la puntuación del índice de inteligencia, el costo total de la evaluación, el costo por tarea, el volumen de tokens de salida y la latencia del primer token provienen de la misma ronda de pruebas públicas de esa organización.