Hugging Face mã nguồn mở 207 kernel GPU cho trình duyệt
Hugging Face ra mắt @huggingface/kernels cùng 207 kernel WebGPU tối ưu, nhanh trung bình 2,57 lần so với ORT WebGPU, giấy phép Apache-2.0.
3 bài đã kiểm chứng về Tối ưu suy luận AI, sản phẩm và diễn biến ngành.
Hugging Face ra mắt @huggingface/kernels cùng 207 kernel WebGPU tối ưu, nhanh trung bình 2,57 lần so với ORT WebGPU, giấy phép Apache-2.0.
Liquid AI phát hành loạt checkpoint LFM2.5 dạng GGUF Q4_0 dùng phương pháp QAD, khôi phục tới 97% độ chính xác so với bản BF16 gốc trên bốn kích thước mô hình.
Google Research công bố TurboQuant, kết hợp hai thuật toán PolarQuant và QJL để nén KV Cache trong suy luận mô hình lớn ít nhất 6 lần mà không cần huấn luyện lại, đạt tốc độ nhanh hơn tới 8 lần trên GPU H100.