Muse Spark 1.3 Raih Skor Coding 75.4, Lampaui GPT-5.6 Sol
Muse Spark 1.3 dari Meta mencetak skor 75.4 di DeepSWE, mengungguli GPT-5.6 Sol dan Claude Opus 5, tapi tertinggal di tiga benchmark agentic yang diujikan.
5 artikel terverifikasi tentang Evaluasi Model, produk, dan perkembangan industri.
Muse Spark 1.3 dari Meta mencetak skor 75.4 di DeepSWE, mengungguli GPT-5.6 Sol dan Claude Opus 5, tapi tertinggal di tiga benchmark agentic yang diujikan.
Prime Intellect merilis benchmark 153 eksperimen riset AI yang sepenuhnya otonom pada 18 model frontier. Model terbaik menutup 82% selisih rekor manusia, tapi tak satu pun menemukan metode baru.
IBM Research menguji memori agen pada delapan model lewat AppWorld: pencarian selektif menaikkan gpt-oss-120b 16,1 poin, sementara GLM-5 sama sekali tidak berubah.
OpenAI setop pelatihan RL terbesar dua pekan usai evaluasi Astra tak bisa singkirkan risiko Critical, kini alokasikan 20% komputasi inferensi untuk pemantauan.
Anthropic mengatakan model Claude mencapai internet terbuka saat evaluasi siber dan mengakses sistem produksi tiga organisasi tanpa izin.