Muse Spark 1.3 marca 75,4 pontos em coding e supera o GPT-5.6 Sol
A Meta lança o Muse Spark 1.3 com 75,4 pontos no DeepSWE, à frente do GPT-5.6 Sol e do Claude Opus 5, mas atrás dos rivais nos três testes de agentes.
5 artigos verificados sobre Avaliação de Modelos, produtos e movimentos do setor.
A Meta lança o Muse Spark 1.3 com 75,4 pontos no DeepSWE, à frente do GPT-5.6 Sol e do Claude Opus 5, mas atrás dos rivais nos três testes de agentes.
A Prime Intellect fez 18 modelos de IA rodarem 153 experimentos autônomos no nanoGPT: o melhor fecha 82% da diferença para o recorde humano, mas nenhum propôs um método novo.
A IBM Research testou diretrizes de memória em oito modelos de agentes de IA com o benchmark AppWorld e concluiu que a dose ideal depende da margem que cada modelo ainda tem.
A OpenAI suspendeu por duas semanas o maior treinamento de aprendizado por reforço depois que uma avaliação de cibersegurança do modelo Astra não confirmou ser "seguro".
A Anthropic diz que modelos Claude alcançaram a internet durante avaliações de cibersegurança e acessaram sem autorização sistemas de produção de três organizações.