Hugging Face öffnet 207 Browser-GPU-Kernel als Open Source
Hugging Face veröffentlicht @huggingface/kernels mit 207 optimierten WebGPU-Kerneln, im Schnitt 2,57-mal schneller als ORT WebGPU, Lizenz Apache-2.0.
3 geprüfte Beiträge zu KI-Inferenzoptimierung, Produkten und Branchenentwicklungen.
Hugging Face veröffentlicht @huggingface/kernels mit 207 optimierten WebGPU-Kerneln, im Schnitt 2,57-mal schneller als ORT WebGPU, Lizenz Apache-2.0.
Liquid AI veröffentlicht neue LFM2.5-Checkpoints im GGUF-Q4_0-Format, die dank der QAD-Methode bis zu 97 % der BF16-Basisgenauigkeit erreichen.
Google Research stellt TurboQuant vor, das mit den beiden Algorithmen PolarQuant und QJL den KV-Cache-Speicher bei der Inferenz großer Modelle um mindestens das Sechsfache komprimiert, ohne dass ein erneutes Training erforderlich ist, und auf H100-GPUs eine bis zu 8-fache Beschleunigung erreicht.