개발자가 Intel Arc A750을 Proxmox 기반 환경에서 llama.cpp의 Vulkan 경로로 구동한 결과, 양자화한 Gemma-4-E4B는 평균 초당 33토큰, 일시적으로 28토큰을 기록했습니다. 반면 일부 계층을 CPU로 넘긴 Gemma-4-26B-A4B는 초당 3.5토큰에 그쳤고 설정 변경 시 충돌도 발생했습니다. 이는 구형 듀얼 Xeon과 64GB 메모리를 사용한 개인 시험으로 드라이버 및 오프로딩 구현의 영향을 분리하지 않았습니다. 보유 장비의 소형 모델 활용 가능성은 보여주지만 새 GPU 구매의 보편적 근거는 아닙니다.
Tech로 돌아가기
Tech
Arc A750 로컬 추론 실험, 소형 모델과 MoE 속도 차이
이미 가진 GPU를 재활용하는 사례로 볼 수 있지만, 모델과 오프로딩 구성이 다르면 같은 성능을 기대하기 어렵습니다.