Hugging Face、ブラウザ用GPUカーネル207種を公開
Hugging FaceがWebGPUカーネル207種とローダー@huggingface/kernelsを公開。809件のベンチマークで幾何平均2.57倍の高速化を確認した。
AI推論最適化に関する製品動向と業界分析を全3件掲載しています。
Hugging FaceがWebGPUカーネル207種とローダー@huggingface/kernelsを公開。809件のベンチマークで幾何平均2.57倍の高速化を確認した。
Liquid AIが新手法QADで、精度の低さから見捨てられていたQ4_0量子化フォーマットをBF16基準の96〜97%まで回復させ、Arm CPUでの速度優位はそのまま維持した。
Google ResearchのTurboQuantは、再トレーニングや精度低下なしに大規模言語モデルのKV Cacheメモリを少なくとも6倍圧縮し、H100 GPUで最大8倍の高速化を実現。