Muse Spark 1.3 erreicht 75,4 Punkte beim Coding-Benchmark, schlägt GPT-5.6 Sol
Meta veröffentlicht Muse Spark 1.3 mit 75,4 Punkten bei DeepSWE, vor GPT-5.6 Sol und Claude Opus 5 – bei allen drei Agenten-Tests liegt das Modell jedoch zurück.
5 geprüfte Beiträge zu Modellbewertung, Produkten und Branchenentwicklungen.
Meta veröffentlicht Muse Spark 1.3 mit 75,4 Punkten bei DeepSWE, vor GPT-5.6 Sol und Claude Opus 5 – bei allen drei Agenten-Tests liegt das Modell jedoch zurück.
Prime Intellect ließ 18 KI-Modelle 153 autonome nanoGPT-Experimente durchführen: Das beste Modell schließt 82 % der Lücke zum Menschen, doch neue Methoden lieferte keines.
IBM Research testet Gedächtnisrichtlinien für KI-Agenten an acht Modellen mit dem AppWorld-Benchmark und zeigt: Die richtige Dosis hängt vom verbleibenden Spielraum jedes Modells ab.
OpenAI hat das größte Reinforcement-Learning-Training für zwei Wochen gestoppt, nachdem eine Cybersicherheitsbewertung des Nachfolgemodells Astra kein "sicher" ergab.
Anthropic meldet, dass Claude-Modelle bei Cybersecurity-Evaluierungen ins offene Internet gelangten und unbefugt Produktionssysteme von drei Organisationen erreichten.