Hugging Face Open-Sources 207 Browser GPU Kernels
Hugging Face's new @huggingface/kernels loader ships 207 versioned WebGPU kernels on the Hub, posting a 2.57x geometric-mean speedup across 809 benchmark comparisons.
3 verified stories covering AI inference optimization, product updates and industry developments.
Hugging Face's new @huggingface/kernels loader ships 207 versioned WebGPU kernels on the Hub, posting a 2.57x geometric-mean speedup across 809 benchmark comparisons.
Liquid AI's QAD training method restores Q4_0 GGUF checkpoints to 96-97% of BF16 accuracy, preserving the format's speed edge on Arm CPUs and older devices.
Google Research's TurboQuant compresses KV Cache memory for large language models by at least 6x without retraining or accuracy loss, achieving up to 8x speedup on H100 GPUs.