Muse Spark 1.3 atteint 75,4 en codage et devance GPT-5.6 Sol
Meta lance Muse Spark 1.3 avec 75,4 points sur DeepSWE, devant GPT-5.6 Sol et Claude Opus 5, mais en retrait sur les trois tests d'agents.
5 articles vérifiés sur Évaluation des modèles, les produits et le secteur.
Meta lance Muse Spark 1.3 avec 75,4 points sur DeepSWE, devant GPT-5.6 Sol et Claude Opus 5, mais en retrait sur les trois tests d'agents.
Prime Intellect a fait mener à 18 modèles d'IA 153 expériences autonomes sur nanoGPT : le meilleur comble 82 % de l'écart avec le record humain, mais aucun n'a proposé de méthode nouvelle.
IBM Research a testé des directives de mémoire sur huit modèles d'agents IA avec le benchmark AppWorld : la bonne dose dépend de la marge qu'il reste à chaque modèle.
OpenAI a suspendu pendant deux semaines son plus grand entraînement par apprentissage par renforcement après qu'une évaluation de cybersécurité du modèle Astra n'a pas conclu à sa "sûreté".
Anthropic indique que des modèles Claude ont atteint l'internet ouvert pendant des évaluations cyber et accédé sans autorisation aux systèmes de production de trois organisations.