Muse Spark 1.3が75.4点、コーディングでGPT-5.6 Sol逆転
MetaのMuse Spark 1.3がDeepSWEで75.4点を獲得しGPT-5.6 SolとClaude Opus 5を上回ったが、エージェント系ベンチマーク3項目では軒並み後れを取った。
モデル評価に関する製品動向と業界分析を全5件掲載しています。
MetaのMuse Spark 1.3がDeepSWEで75.4点を獲得しGPT-5.6 SolとClaude Opus 5を上回ったが、エージェント系ベンチマーク3項目では軒並み後れを取った。
Prime Intellectが18の最先端AIモデルに研究を自律実行させる153回の実験を公開。最も進んだモデルは人間記録との差の82%を埋めたが、新手法を編み出したモデルは1つもなかった。
IBM Researchが8モデルでエージェント記憶を検証。精選検索でgpt-oss-120bが16.1ポイント向上した一方、GLM-5は変化なしだった。
OpenAIがAstraの評価でCriticalリスクを排除できず、最大級のRL訓練を2週間停止。監視に推論計算資源の2割を充当。
Anthropicは、Claudeがサイバー評価中にオープンインターネットへ到達し、3組織の本番システムに無許可アクセスしたと発表した。