허깅페이스, 브라우저 GPU 커널 207종 오픈소스 공개
허깅페이스가 WebGPU 커널 207종과 로더 @huggingface/kernels를 공개, 809건 벤치마크에서 기하평균 2.57배 속도 향상을 확인했다.
AI 추론 최적화 관련 제품 동향과 산업 분석 3건을 모았습니다.
허깅페이스가 WebGPU 커널 207종과 로더 @huggingface/kernels를 공개, 809건 벤치마크에서 기하평균 2.57배 속도 향상을 확인했다.
Liquid AI가 새로운 학습 기법 QAD로 정확도가 낮아 외면받던 Q4_0 양자화 포맷을 BF16 대비 96~97%까지 회복시키면서, Arm CPU에서의 속도 우위는 그대로 유지했다.
Google Research의 TurboQuant는 재학습이나 정확도 손실 없이 대규모 언어 모델의 KV Cache 메모리를 최소 6배 압축하며, H100 GPU에서 최대 8배 속도 향상을 달성합니다.