LLM 배포 형식을 정리한 기술 가이드는 GGUF와 safetensors 같은 파일 컨테이너를 GPTQ나 AWQ 같은 양자화 방법과 구분했습니다. GGUF는 llama.cpp 계열에서 CPU와 GPU를 함께 쓰기 쉽고, GPTQ와 AWQ는 지원되는 GPU 서버 런타임, EXL2와 EXL3는 ExLlama 계열과 밀접하게 연결됩니다. Apple Silicon의 Python 작업에는 MLX도 선택지가 됩니다. 같은 4비트 표기라도 저장 구조와 실제 속도는 다르며 모델 가중치 외에 KV 캐시와 실행 여유 메모리가 필요합니다. 파일명만 보고 용량이나 호환성을 단정하지 않는 것이 핵심입니다.