Hugging Face開源207個瀏覽器GPU核心
Hugging Face推出207個WebGPU核心與載入函式庫,809組對照測試顯示幾何平均加速2.57倍,鎖定瀏覽器端推理效能瓶頸。
收錄 AI 推理最佳化 相關產品動態與產業觀察,共 3 篇文章。
Hugging Face推出207個WebGPU核心與載入函式庫,809組對照測試顯示幾何平均加速2.57倍,鎖定瀏覽器端推理效能瓶頸。
Liquid AI用QAD訓練法把長期被棄用的Q4_0量化格式精度拉回BF16的96%到97%,同時保留其在Arm CPU上的速度優勢。
Google Research 的 TurboQuant 可在無需重新訓練、不損失精度的情況下,將大型語言模型推理時的 KV Cache 記憶體佔用壓縮至少 6 倍,並在 H100 GPU 上實現最高 8 倍加速。