Hugging Face open source 207 kernels GPU pour navigateur
Hugging Face lance @huggingface/kernels avec 207 kernels WebGPU optimisés, en moyenne 2,57x plus rapides qu'ORT WebGPU, sous licence Apache-2.0.
3 articles vérifiés sur Optimisation inférence IA, les produits et le secteur.
Hugging Face lance @huggingface/kernels avec 207 kernels WebGPU optimisés, en moyenne 2,57x plus rapides qu'ORT WebGPU, sous licence Apache-2.0.
Liquid AI publie de nouveaux checkpoints de la série LFM2.5 au format GGUF Q4_0, entraînés avec la méthode QAD, retrouvant jusqu'à 97 % de la précision de référence en BF16.
Google Research dévoile TurboQuant, qui combine les algorithmes PolarQuant et QJL pour compresser la mémoire du cache KV lors de l'inférence de grands modèles d'au moins 6 fois sans réentraînement, atteignant jusqu'à 8 fois plus de vitesse sur GPU H100.