ByteDance Seed와 칭화대 연구진의 CUDA Agent는 GPU에서 커널을 직접 작성, 실행, 프로파일링하고 결과를 바탕으로 다시 최적화하는 과정을 강화학습으로 익혔습니다. 연구진은 KernelBench에서 torch.compile과 상용 AI 모델보다 높은 성능을 보고했습니다. 이는 코드 한 번 생성이 아니라 실제 하드웨어 피드백을 닫힌 루프로 쓰는 접근이며 다른 GPU와 운영 코드에서의 재현성은 추가 검증이 필요합니다.
Tech로 돌아가기
Tech
CUDA Agent가 실행과 프로파일링을 반복해 GPU 커널을 최적화합니다
GPU 최적화도 코드 생성보다 실행 결과를 측정하고 반복 개선하는 에이전트 루프가 핵심이 되고 있습니다.