オンデバイスAI 2026-08-19 Liquid AI、蒸留でQ4_0精度97%に回復 Liquid AIが新手法QADで、精度の低さから見捨てられていたQ4_0量子化フォーマットをBF16基準の96〜97%まで回復させ、Arm CPUでの速度優位はそのまま維持した。 #オープンソース#AI推論最適化#大規模モデル効率
Google 2026-04-20 Google TurboQuant、AI推論メモリを6倍圧縮 Google ResearchのTurboQuantは、再トレーニングや精度低下なしに大規模言語モデルのKV Cacheメモリを少なくとも6倍圧縮し、H100 GPUで最大8倍の高速化を実現。 #AI推論最適化#大規模モデル効率#技術的ブレークスルー