VC-Attention 연구는 영상 생성 모델의 값 벡터 이상치를 묶어 평균을 분리하는 V-Smooth와 softmax 계산을 줄이는 ExpCast-FP8을 결합했습니다. 재학습 없이 저비트 attention의 정확도와 속도를 개선하는 방식으로, 네 영상 모델 실험에서 데이터센터 GPU의 커널은 BF16 FlashAttention-4 대비 1.461.59배 빨라졌지만 전체 생성은 1.131.19배 개선됐습니다. 워크스테이션 카드의 전체 개선은 1.36~1.70배였습니다. 수치는 해당 모델과 장비의 측정 결과이며, 보도 시점 공개 커널이 없어 실제 도입 전 재현 가능성을 확인해야 합니다.
Tech로 돌아가기
Tech
VC-Attention, 저비트 영상 생성의 연산 병목 완화
커널 속도 개선과 전체 영상 생성 시간의 개선 폭은 다르며 공개 구현 여부도 확인해야 합니다.