Hugging Face Rilis 207 Kernel GPU Browser sebagai Open Source
Hugging Face merilis 207 kernel WebGPU beserta pustaka loader-nya, mencatat percepatan rata-rata geometris 2,57x dari 809 uji banding.
3 artikel terverifikasi tentang Optimasi Inferensi AI, produk, dan perkembangan industri.
Hugging Face merilis 207 kernel WebGPU beserta pustaka loader-nya, mencatat percepatan rata-rata geometris 2,57x dari 809 uji banding.
Metode pelatihan QAD dari Liquid AI memulihkan akurasi checkpoint Q4_0 hingga 96-97% dari BF16, sambil tetap mempertahankan keunggulan kecepatannya di CPU Arm.
TurboQuant dari Google Research mengompres memori KV Cache untuk model bahasa besar setidaknya 6x tanpa perlu pelatihan ulang atau kehilangan akurasi, mencapai akselerasi hingga 8x pada GPU H100.