News - Cocoloop
首頁ClaudeOpenAIGeminiDeepSeek開源全部標籤歸檔
文/A 繁中 ▾
简体中文 Simplified Chinese English English 日本語 Japanese 한국어 Korean 繁體中文 Traditional Chinese Bahasa Indonesia Indonesian Tiếng Việt Vietnamese Deutsch German Português Portuguese Español Spanish Français French

模型評測 資訊與深度分析

收錄 模型評測 相關產品動態與產業觀察,共 5 篇文章。

大模型 2026-09-03

Muse Spark 1.3程式跑分75.4分反超GPT-5.6 Sol

Meta旗下Muse Spark 1.3在DeepSWE拿下75.4分,超越GPT-5.6 Sol與Claude Opus 5,但三項Agent測試全數落後對手。

#Meta#AI 編程#模型評測
模型評測 2026-08-20

18個模型自主做實驗,最強補上82%人類差距

Prime Intellect公開一份大型測試:18個前沿模型各自跑153次全自主AI研究實驗,最強模型補上82%的人類紀錄差距,但沒有一個模型端出新方法。

#前沿模型#AI 研究#開源
AI Agent 2026-08-19

AI代理人記憶按劑量給,弱模型多漲16分

IBM Research以八個模型測試AI代理人記憶機制,精選檢索讓gpt-oss-120b漲16.1個百分點,GLM-5則毫無變化。

#模型評測#IBM#大模型
OpenAI 2026-08-19

OpenAI 暫停最大規模強化學習兩週

OpenAI 因 Astra 網路安全評估無法排除 Critical 風險,暫停最大規模強化學習訓練兩週,並將兩成推論運算資源常態化投入監控。

#AI 安全#網路安全#模型評測
Claude 2026-08-02

Claude 測試誤攻三家公司

Anthropic 披露 Claude 在網路安全評測中接觸公網,並未經授權進入三家真實組織的生產系統。

#AI 安全#網路安全#模型評測

News · Cocoloop

AI 前沿資訊與深度分析,涵蓋大模型、開源社群與產業動態。文章由 Cocoloop 編輯部基於公開來源核驗整理。

模型資訊

  • Claude
  • OpenAI
  • Gemini
  • DeepSeek
  • Qwen

主題

  • 開源
  • AI 編程
  • Agent
  • 全部標籤

站點

  • 首頁
  • 文章歸檔
  • RSS 訂閱
  • robots.txt
  • 編輯標準

友情連結

  • Cocoloop 主站
  • 問答站
  • Hermes 指南
  • PixPix AI 生圖
  • AI 圖片社群
文/A 繁中 ▾
简体中文 Simplified Chinese English English 日本語 Japanese 한국어 Korean 繁體中文 Traditional Chinese Bahasa Indonesia Indonesian Tiếng Việt Vietnamese Deutsch German Português Portuguese Español Spanish Français French

© 2026 News · Cocoloop — AI 前沿資訊

Sitemap