Fable 5.1: el precio de lectura de caché cae a un cuarto

Anthropic lanzó Claude Fable 5.1, con el ID de modelo claude-fable-5-1, disponible al mismo tiempo en la Claude API y a través de Bedrock, Google Cloud y Microsoft Foundry. Mythos 5.1, con especificaciones y precios idénticos, se lanzó en el mismo período, pero por ahora solo para clientes invitados.

La base sigue siendo la de la generación anterior: ventana de contexto de 1 millón de tokens con tarifa unificada, salida máxima de 128.000 tokens, razonamiento adaptativo activado por defecto, corte de conocimiento fiable en junio de 2026.

Toda la tabla de precios cambió en una sola celda

10 dólares por entrada y 50 dólares por salida por millón de tokens, igual que en la generación anterior; el precio de escritura de caché tampoco cambió. Lo único que cambia es la lectura de caché: Fable 5.1 la cobra a 0,025 veces el precio base de entrada, es decir, 0,25 dólares por millón de tokens; en el resto de los modelos Claude el factor es 0,1.

Esta rebaja solo aplica a un tipo de uso concreto: cuando se relee repetidamente el mismo tramo de prefijo. Un cálculo rápido: un prompt de sistema más el prefijo de una base de código, con 200.000 tokens en total, releído 100 veces en una sesión de agente de varias horas, da 20 millones de tokens de lectura de caché — 20 dólares al precio antiguo, 5 dólares al nuevo. El precio de escritura y la longitud mínima cacheable de 512 tokens no cambian; todo el ahorro viene de esta acción de "releer".

Los agentes de larga duración son precisamente el escenario con la relectura más intensa. Colocar la rebaja justo en esta celda es una señal bastante clara.

Tres cambios que provocan errores directos

Quien migre desde la generación anterior y solo cambie el ID del modelo sin ajustar el código tendrá problemas.

Se elimina la llamada forzada a herramientas. Si se establece tool_choice en any o se fuerza una herramienta concreta, la respuesta es directamente un error 400. La explicación oficial es que, como el razonamiento de este modelo está siempre activo, una llamada forzada se saltaría el razonamiento y el modelo terminaría escribiendo el proceso de deducción dentro de los parámetros de la herramienta, lo que reduciría su calidad. Para obtener JSON estructuralmente válido, se recomienda usar el modo estricto o las salidas estructuradas.

Los bloques de razonamiento ahora reconocen su modelo de origen. Cada bloque de razonamiento registra qué modelo lo generó y solo puede transmitirse en una dirección: Fable 5.1 puede leer bloques de razonamiento de modelos anteriores, pero no al revés. Si la sesión sube de versión, la cadena de razonamiento se conserva; si baja de versión, el razonamiento de esas rondas se pierde. En el enrutamiento o el fallback que cambian de modelo a mitad de sesión, la API descarta en silencio los bloques ilegibles, sin cobrarlos y, por defecto, sin avisar.

Modificar el historial invalida todos los bloques de razonamiento posteriores. Tocar cualquier cosa anterior a un bloque de razonamiento —el prompt de sistema, el array de herramientas, un mensaje anterior— hace que la siguiente solicitud devuelva error 400. Esta regla es obligatoria para las cuentas creadas a partir del 31 de agosto. El error más común es inyectar un recordatorio temporal en el historial en cada ronda y eliminarlo en la siguiente, o reconstruir el prompt de sistema entre dos solicitudes. Quien use los clientes oficiales no tiene que preocuparse; el riesgo recae en las integraciones que arman el array de mensajes por su cuenta.

Lo que se ahorra en la entrada puede volver a cobrarse en la salida

Más relevante que los cambios que rompen el código son los cambios de comportamiento por defecto que ocurren solos, sin tocar nada. Anthropic enumera siete en total, tres de ellos ligados directamente a la factura.

El primero es que las llamadas paralelas a herramientas se vuelven menos estables: donde la generación anterior enviaba varias llamadas juntas en una ronda, 5.1 a veces envía solo una por ronda —la documentación dice que la calidad de las respuestas no baja, pero más rondas consumen más tokens y más idas y vueltas. El segundo es una mayor tendencia a reescribir el archivo entero; el resultado suele ser el mismo, pero el gasto extra recae en los tokens de salida. El tercero es que, en niveles de esfuerzo bajos, el modelo recurre menos a la búsqueda y responde más de memoria.

Si se ponen estos puntos junto a la tabla de precios, lo que hace 5.1 es menos una rebaja de precio y más un traslado del costo de la entrada hacia las rondas. La lectura de caché es tres cuartas partes más barata, pero las llamadas a herramientas más fragmentadas y las reescrituras de archivos completos consumen el precio de salida de 50 dólares por millón, cinco veces más caro que la entrada. Que la factura suba o baje depende de qué lado pese más en el bucle concreto del agente: releer el contexto repetidamente o generar contenido repetidamente. Volver a correr la evaluación después de migrar y de paso revisar la factura sigue siendo un paso que no se puede saltar.

De las cuatro nuevas funciones en beta, dos —ajustar el nivel de esfuerzo a mitad de sesión y un mensaje de sistema válido solo para una ronda— están pensadas justamente para evitar estos escollos. Además hay un etiquetado de contenido activado por defecto: el texto generado lleva una marca de agua estadística en todas las plataformas, y las imágenes y vídeos obtenidos incluyen credenciales C2PA.

La mayor diferencia de benchmarks está en el agente de investigación científica

En la comparativa oficial publicada, las mejoras varían mucho de una prueba a otra:

BenchmarkFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1 (agentic scientific research)52.6%24.7%29.0%22.4%
Terminal-Bench 4.0 (agentic coding)55.8%42.0%52.3%37.3%
GDPval-AA v2 (knowledge work, score)1853172318241711
OSWorld 2.0 (computer use, partial / strict)77.9% / 41.7%72.9% / 36.1%75.4% / 39.6%
Humanity's Last Exam (no tools / with tools)60.9% / 65.0%57.8% / 63.8%56.6% / 63.6%
AutomationBench (business workflows)31.4%17.1%26.9%19.6%
CursorBench 3.2.0 (agentic coding)73.4%70.5%70.0%67.2%

La mayor diferencia está en el agente de investigación científica: 52,6% frente al 24,7% de la generación anterior, más del doble. Es también el único punto en el que la generación anterior quedaba claramente por detrás de Opus 5 (24,7% frente a 29,0%) — 5.1 corrige esa debilidad en lugar de mejorar todo por igual. La columna de procesos de negocio sigue el mismo patrón, 31,4% frente a 17,1%. Mythos 5.1 reporta por separado un 60,9% en Terminal-Bench 4.0.

En cambio, en las tareas cotidianas el panorama es distinto: CursorBench sube de 70,5% a 73,4%, solo 2,9 puntos porcentuales más; Humanity's Last Exam con herramientas gana 1,2 puntos porcentuales; en trabajo de conocimiento, 1853 frente a 1824 de Opus 5, una diferencia de 29 puntos. Estas cifras encajan con el apartado de precios — pagar el doble compra capacidad para tareas largas y de alta dificultad, mientras que la diferencia en programación cotidiana y respuestas habituales es demasiado pequeña como para justificar el precio. La recomendación oficial va en la misma línea: la mayoría de las cargas de trabajo deberían seguir empezando con Opus 5, dejando Fable 5.1 para el razonamiento de alta dificultad y los agentes de larga duración. La diferencia de precio habla por sí sola: Opus 5 cuesta 5 y 25 dólares, y además es más rápido.

Fuentes: documentación de modelos de Anthropic, CocoLoop, página de notas de versión; los precios, las especificaciones de contexto y los cambios disruptivos se contrastaron según lo revelado en la documentación oficial; el costo de las sesiones largas es una estimación aproximada basada en las tarifas públicas.