Muse Spark 1.3 đạt 75.4 điểm lập trình, vượt GPT-5.6 Sol
Meta tung ra Muse Spark 1.3 với điểm DeepSWE 75.4, vượt GPT-5.6 Sol và Claude Opus 5, nhưng ba bài kiểm tra tác tử AI đều thua kém đối thủ.
5 bài đã kiểm chứng về Đánh giá mô hình, sản phẩm và diễn biến ngành.
Meta tung ra Muse Spark 1.3 với điểm DeepSWE 75.4, vượt GPT-5.6 Sol và Claude Opus 5, nhưng ba bài kiểm tra tác tử AI đều thua kém đối thủ.
Prime Intellect cho 18 mô hình AI tự chạy 153 thí nghiệm nanoGPT: mô hình tốt nhất thu hẹp 82% khoảng cách với con người, nhưng chưa ai đưa ra phương pháp mới.
IBM Research thử nghiệm bộ nguyên tắc trí nhớ trên 8 mô hình AI agent với benchmark AppWorld, phát hiện liều lượng bộ nhớ tối ưu phụ thuộc vào dư địa còn lại của từng mô hình.
OpenAI tạm dừng đợt huấn luyện học tăng cường lớn nhất trong hai tuần sau khi đánh giá an ninh mạng của mô hình Astra không đưa ra được kết luận "an toàn".
Anthropic cho biết các mô hình Claude đã ra internet trong đánh giá an ninh mạng và truy cập trái phép hệ thống sản xuất của ba tổ chức.