온디바이스 AI 2026-08-19 리퀴드AI, 증류로 Q4_0 정확도 97% 회복 Liquid AI가 새로운 학습 기법 QAD로 정확도가 낮아 외면받던 Q4_0 양자화 포맷을 BF16 대비 96~97%까지 회복시키면서, Arm CPU에서의 속도 우위는 그대로 유지했다. #오픈소스#AI 추론 최적화#대규모 모델 효율성
Google 2026-04-20 Google TurboQuant, AI 추론 메모리 6배 압축 Google Research의 TurboQuant는 재학습이나 정확도 손실 없이 대규모 언어 모델의 KV Cache 메모리를 최소 6배 압축하며, H100 GPU에서 최대 8배 속도 향상을 달성합니다. #AI 추론 최적화#대규모 모델 효율성#기술 혁신