Three-LLM 개발자는 언어 모델의 추론 그래프를 Three.js TSL 계산 셰이더로 구성해 브라우저 GPU에서 실행하는 방식을 공개했다. Hugging Face 설정과 SafeTensors 가중치를 읽으며 GPT-2, Qwen, Phi 계열 등의 데모를 제공한다. 서버 추론은 필요 없지만 가중치를 32비트로 확장하므로 큰 모델은 모바일 메모리를 넘을 수 있다. 교육용 구조 설명과 실제 기기 성능 검증은 구분해야 한다.
Tech로 돌아가기
Tech
Three-LLM, Three.js와 WebGPU로 브라우저 추론 구현
렌더링 도구의 계산 기능을 재사용하지만 모델 다운로드와 메모리 제약은 남습니다.