LM Studio 사용자는 Llama 3.1 8B에 Llama 3.2 1B를 초안 모델로 붙여 같은 프롬프트를 세 번씩 측정한 결과 생성 속도가 초당 23.35토큰에서 29.46토큰으로 늘었다고 보고했습니다. 작은 모델이 미리 낸 토큰을 큰 모델이 검증하는 speculative decoding을 활용한 사례입니다. 단일 환경의 약 26% 개선이며 초안 모델도 메모리와 연산 자원을 더 사용합니다. 모델과 토크나이저의 호환성을 확인하고 실제 작업에서 기능을 켠 경우와 끈 경우를 비교해야 합니다.