Hugging Face가 Transformers의 익숙한 API로 GGUF 양자화 모델을 효율적으로 실행하는 지원을 소개했다. ggml 커널을 재사용하고 생성 경로의 부담을 줄이며 초기 대상은 Apple Silicon과 Qwen3.5 계열이다. 현재 개발 브랜치와 호환 PyTorch 및 커널 조건이 필요하고 커널이 없으면 역양자화 경로로 더 많은 메모리를 쓸 수 있다. 모든 모델과 GPU가 같은 효율을 얻는 정식 범용 지원으로 해석해서는 안 된다.