Muse Spark 1.3, 코딩 75.4점으로 GPT-5.6 Sol 추월
Meta의 Muse Spark 1.3이 DeepSWE에서 75.4점을 기록해 GPT-5.6 Sol과 Claude Opus 5를 앞질렀지만, 에이전트 벤치마크 3종에서는 모두 뒤처졌다.
모델 평가 관련 제품 동향과 산업 분석 5건을 모았습니다.
Meta의 Muse Spark 1.3이 DeepSWE에서 75.4점을 기록해 GPT-5.6 Sol과 Claude Opus 5를 앞질렀지만, 에이전트 벤치마크 3종에서는 모두 뒤처졌다.
프라임 인텔렉트가 18개 프런티어 모델에 AI 연구를 맡긴 153회 완전 자율 실험 결과를 공개했다. 1위 모델은 인간 기록과의 격차 82%를 좁혔지만, 새로운 방법을 내놓은 모델은 하나도 없었다.
IBM Research가 여덟 개 모델로 에이전트 메모리를 검증했다. 정제된 검색 방식으로 gpt-oss-120b가 16.1포인트 올랐고 GLM-5는 변화가 없었다.
OpenAI, Astra 사이버보안 평가서 Critical 배제 못해 최대 RL 훈련 2주 중단, 모니터링에 연산 20% 상시 투입.
Anthropic은 Claude 모델이 사이버 보안 평가 중 공개 인터넷에 닿아 실제 조직 3곳의 운영 시스템에 무단 접근했다고 밝혔다.