端側 AI 2026-08-19 Liquid AI蒸餾法救回Q4_0至97%精度 Liquid AI用QAD訓練法把長期被棄用的Q4_0量化格式精度拉回BF16的96%到97%,同時保留其在Arm CPU上的速度優勢。 #開源#AI 推理最佳化#大模型效率
Google 2026-04-20 Google TurboQuant 將 AI 推理記憶體壓縮 6 倍 Google Research 的 TurboQuant 可在無需重新訓練、不損失精度的情況下,將大型語言模型推理時的 KV Cache 記憶體佔用壓縮至少 6 倍,並在 H100 GPU 上實現最高 8 倍加速。 #AI 推理最佳化#大模型效率#技術突破