Liquid AI가 LFM2.5-VL-3B에 약 2억8000만 매개변수의 초안 모델을 더해 투기적 디코딩을 수행하는 구성을 공개했습니다. llama.cpp와 MLX-VLM 및 SGLang 연동을 제공하며 자체 시험에서 기기별 디코딩과 전체 지연시간 개선을 보고했습니다. 최대 디코딩 배수와 입력 처리까지 포함한 전체 배수는 다릅니다. 이미지 전처리와 프리필 비중이 큰 작업에서는 이득이 작아질 수 있어 실제 하드웨어와 작업으로 메모리 비용을 함께 평가해야 합니다.