Muse Spark 1.3 anota 75,4 en programación y supera a GPT-5.6 Sol

Mark Zuckerberg anunció el despliegue de Muse Spark 1.3, disponible al mismo tiempo en Muse Code y en la API de modelos de Meta. Lo describió como "la mayor actualización de la serie hasta la fecha en programación y trabajo con agentes" y afirmó que el coste de alcanzar un rendimiento de vanguardia ya es prácticamente insignificante.

Los benchmarks dan la mitad de la respuesta. En DeepSWE v1.1, Muse Spark 1.3 obtuvo 75,4 puntos, frente a 73,0 de GPT-5.6 Sol y 74,0 de Claude Opus 5. En Terminal-Bench 2.1 logró 88,8 puntos, y en SWEAtlas CodeBase QnA, 59,4. En las dos pruebas de contexto largo se acerca al máximo: MRCR alcanza 98,5 en el tramo de 256K–512K y 98,1 en el de 512K–1M. Frente a la versión anterior, la 1.2, en las mismas tareas de codificación el número de llamadas a herramientas cae cerca de un 20% y el consumo de tokens, cerca de un 25%. Para quienes pagan por token, este dato pesa más que la puntuación del benchmark.

El nivel barato, sostenido con cifras

La frase "coste prácticamente insignificante" hay que desglosarla. Meta fijó dos niveles de precio para Muse Spark 1.3: la versión estándar cuesta 1,25 dólares por millón de tokens de entrada y 4,25 dólares por millón de tokens de salida; la versión "contribuidor" cuesta 0,10 dólares en la entrada y 0,20 en la salida. La diferencia es de 12,5 veces en la entrada y de 21 veces en la salida.

El precio de esa diferencia está en las condiciones de uso: quien utiliza la versión contribuidor cede sus entradas y salidas para que Meta mejore el producto. Este esquema ya existía en la versión 1.2, y la 1.3 simplemente lo mantiene. Para desarrolladores individuales y equipos pequeños, un precio de entrada de diez centavos equivale casi a uso gratuito; para empresas con exigencias de confidencialidad del código, ese nivel resulta prácticamente inutilizable, y solo les queda el precio estándar de 1,25 dólares, que entre modelos de la misma generación no es precisamente barato. Lo de "prácticamente insignificante" se refiere solo a ese primer nivel.

Por delante en programación, por detrás en agentes

En el Índice de Inteligencia de Artificial Analysis, Muse Spark 1.3 (modo xhigh) obtuvo 61 puntos, empatado con GPT-5.6 Sol (max) y Grok 4.6 (high); Claude Opus 5 (max) sigue en cabeza con 63 puntos.

La verdadera brecha aparece en los proyectos de agentes. En GDPVal-AA v2, Muse Spark 1.3 anotó 1754 puntos frente a 1824 de Claude Opus 5; en OSWorld 2.0, 66,9 frente a 68,3; en AutomationBench, 49,4 frente a 50,3. Perdió en las tres, por márgenes pequeños, pero en la misma dirección. La frase que Zuckerberg repitió en la conferencia de resultados, sobre "un agente personal que trabaja para ti las 24 horas del día, los 7 días de la semana", según estas cifras todavía queda lejos.

Dos incógnitas sin resolver

El modo de razonamiento más potente se publicará solo tras completar las pruebas de seguridad, y también está prevista una versión de pesos abiertos, aunque sin fecha para ninguna de las dos. La versión 1.3 incorpora refuerzos frente a entradas adversariales e inyección de prompts, algo previsible después de que la generación anterior de modelos de pesos abiertos fuera modificada de todas las formas posibles por terceros.

Un cálculo aproximado: si el precio de la versión contribuidor se mantiene a largo plazo, un agente de codificación que consuma 5 millones de tokens de entrada al día costaría unos 15 dólares al mes. La cifra no tiene nada de sofisticado técnicamente, pero es la que determina cuánta gente estará dispuesta a incorporar Muse Spark a su flujo de trabajo diario. Y el código que esas personas escriban será precisamente la materia prima de entrenamiento para la siguiente versión.

Fuentes: página de precios de la API de modelos de Meta, índice de Artificial Analysis, CocoLoop, página de modelos de OpenRouter; los precios de ambos niveles de API y las puntuaciones de DeepSWE, MRCR y Terminal-Bench se cotejaron uno por uno.