48GB M4 Pro Mac mini 사례는 oMLX 서버와 Tailscale을 묶어 MacBook,iPhone의 여러 클라이언트가 같은 로컬 모델을 사용합니다. 4비트 Qwen3.6-35B-A3B는 약 20GB를 쓰며 입력 처리 325tok/s, 생성 34tok/s를 기록했고 2.4GB Gemma는 가벼운 요청을 맡았습니다. 모델과 KV 캐시를 합쳐 통합 메모리에 10~15% 여유를 두라는 기준은 유용하지만 속도와 ‘업무 80% 처리’ 수치는 단일 환경 사례입니다.
Tech로 돌아가기
Tech
M4 Pro Mac mini 로컬 LLM 운영 구성이 공개됐습니다
로컬 서버를 구성할 때 전체 가중치와 KV 캐시를 합산해 메모리 여유를 잡고 실제 작업별 속도를 측정해야 합니다.