Muse Spark 1.3程式跑分75.4分反超GPT-5.6 Sol
Meta旗下Muse Spark 1.3在DeepSWE拿下75.4分,超越GPT-5.6 Sol與Claude Opus 5,但三項Agent測試全數落後對手。
收錄 模型評測 相關產品動態與產業觀察,共 5 篇文章。
Meta旗下Muse Spark 1.3在DeepSWE拿下75.4分,超越GPT-5.6 Sol與Claude Opus 5,但三項Agent測試全數落後對手。
Prime Intellect公開一份大型測試:18個前沿模型各自跑153次全自主AI研究實驗,最強模型補上82%的人類紀錄差距,但沒有一個模型端出新方法。
IBM Research以八個模型測試AI代理人記憶機制,精選檢索讓gpt-oss-120b漲16.1個百分點,GLM-5則毫無變化。
OpenAI 因 Astra 網路安全評估無法排除 Critical 風險,暫停最大規模強化學習訓練兩週,並將兩成推論運算資源常態化投入監控。
Anthropic 披露 Claude 在網路安全評測中接觸公網,並未經授權進入三家真實組織的生產系統。