Hugging Face abre 207 kernels de GPU para navegador
Hugging Face lança @huggingface/kernels com 207 kernels WebGPU otimizados, em média 2,57x mais rápidos que o ORT WebGPU, sob licença Apache-2.0.
3 artigos verificados sobre otimização de inferência de IA, produtos e movimentos do setor.
Hugging Face lança @huggingface/kernels com 207 kernels WebGPU otimizados, em média 2,57x mais rápidos que o ORT WebGPU, sob licença Apache-2.0.
Liquid AI lança novos checkpoints da série LFM2.5 em formato GGUF Q4_0, treinados com o método QAD, recuperando até 97% da precisão original em BF16.
O Google Research apresentou o TurboQuant, que combina os algoritmos PolarQuant e QJL para comprimir a memória do KV Cache durante a inferência de grandes modelos em pelo menos 6 vezes sem necessidade de retreinamento, alcançando até 8 vezes mais velocidade em GPUs H100.