ByteDance Seed와 칭화대 연구진의 CUDA Agent는 GPU에서 커널을 직접 작성, 실행, 프로파일링하고 결과를 바탕으로 다시 최적화하는 과정을 강화학습으로 익혔습니다. 연구진은 KernelBench에서 torch.compile과 상용 AI 모델보다 높은 성능을 보고했습니다. 이는 코드 한 번 생성이 아니라 실제 하드웨어 피드백을 닫힌 루프로 쓰는 접근이며 다른 GPU와 운영 코드에서의 재현성은 추가 검증이 필요합니다.