News - Cocoloop
首頁ClaudeOpenAIGeminiDeepSeek開源全部標籤歸檔
文/A 繁中 ▾
简体中文 Simplified Chinese English English 日本語 Japanese 한국어 Korean 繁體中文 Traditional Chinese Bahasa Indonesia Indonesian Tiếng Việt Vietnamese Deutsch German Português Portuguese Español Spanish Français French

推理優化 資訊與深度分析

收錄 推理優化 相關產品動態與產業觀察,共 5 篇文章。

MiniMax 2026-08-28

SGLang讓MiniMax-H3無損提速1.95倍

LMSYS用8張H200實測MiniMax-H3推理效能,SGLang無損路徑比Diffusers快up to 1.95倍,犧牲SSIM畫質最高可到6倍。

#推理優化#影片生成#開源
推理優化 2026-08-22

四卡讓螞蟻Ling-3.0-flash快2.1倍

SGLang與螞蟻Ling Infra團隊在4張Blackwell顯示卡上,把Ling-3.0-flash單一請求的生成延遲從3.33毫秒降到0.78毫秒。

#螞蟻集團#開源
AI 基礎設施 2026-08-22

兆級模型重啟從8.8分鐘壓到32秒

螞蟻集團與SGLang團隊打造Weight Cache Daemon,讓量化後的權重常駐GPU記憶體,將Ling-2.6-1T的重啟時間從8.8分鐘壓縮到約32秒。

#推理優化#開源#螞蟻集團
推理優化 2026-08-20

H20 跑 V4-Pro 達 B300 七成速度

LMSYS 團隊公開 DeepSeek-V4-Pro 服務端最佳化數據,在中國特規卡 H20 上,單批解碼與旗艦卡 B300 的差距已縮小到 1.42 倍。

#DeepSeek#AI 晶片#國產算力
NVIDIA 2026-05-21

NVIDIA融合擴散與自迴歸,發表新模型Nemotron-Labs-Diffusion

NVIDIA的Nemotron-Labs-Diffusion在單一模型中支援三種解碼模式,吞吐量最高可達Qwen3-8B的6倍,同時維持準確度。

#擴散模型#開源#推理優化

News · Cocoloop

AI 前沿資訊與深度分析,涵蓋大模型、開源社群與產業動態。文章由 Cocoloop 編輯部基於公開來源核驗整理。

模型資訊

  • Claude
  • OpenAI
  • Gemini
  • DeepSeek
  • Qwen

主題

  • 開源
  • AI 編程
  • Agent
  • 全部標籤

站點

  • 首頁
  • 文章歸檔
  • RSS 訂閱
  • robots.txt
  • 編輯標準

友情連結

  • Cocoloop 主站
  • 問答站
  • Hermes 指南
  • PixPix AI 生圖
  • AI 圖片社群
文/A 繁中 ▾
简体中文 Simplified Chinese English English 日本語 Japanese 한국어 Korean 繁體中文 Traditional Chinese Bahasa Indonesia Indonesian Tiếng Việt Vietnamese Deutsch German Português Portuguese Español Spanish Français French

© 2026 News · Cocoloop — AI 前沿資訊

Sitemap