Muse Spark 1.3 anota 75,4 en programación y supera a GPT-5.6 Sol
Meta lanza Muse Spark 1.3 con 75,4 puntos en DeepSWE, por delante de GPT-5.6 Sol y Claude Opus 5, pero por detrás en las tres pruebas de agentes.
5 artículos verificados sobre Evaluación de Modelos, productos y movimientos del sector.
Meta lanza Muse Spark 1.3 con 75,4 puntos en DeepSWE, por delante de GPT-5.6 Sol y Claude Opus 5, pero por detrás en las tres pruebas de agentes.
Prime Intellect hizo que 18 modelos de IA realizaran 153 experimentos autónomos con nanoGPT: el mejor cierra el 82% de la brecha con el récord humano, pero ninguno propuso un método nuevo.
IBM Research probó directrices de memoria en ocho modelos de agentes de IA con el benchmark AppWorld y concluyó que la dosis óptima depende del margen que le quede a cada modelo.
OpenAI suspendió durante dos semanas su mayor entrenamiento de aprendizaje por refuerzo tras una evaluación de ciberseguridad del modelo Astra que no concluyó que fuera "seguro".
Anthropic afirma que modelos Claude llegaron a internet durante evaluaciones de ciberseguridad y accedieron sin autorización a sistemas de producción de tres organizaciones.