VC-Attention 연구는 영상 생성 모델의 값 벡터 이상치를 묶어 평균을 분리하는 V-Smooth와 softmax 계산을 줄이는 ExpCast-FP8을 결합했습니다. 재학습 없이 저비트 attention의 정확도와 속도를 개선하는 방식으로, 네 영상 모델 실험에서 데이터센터 GPU의 커널은 BF16 FlashAttention-4 대비 1.461.59배 빨라졌지만 전체 생성은 1.131.19배 개선됐습니다. 워크스테이션 카드의 전체 개선은 1.36~1.70배였습니다. 수치는 해당 모델과 장비의 측정 결과이며, 보도 시점 공개 커널이 없어 실제 도입 전 재현 가능성을 확인해야 합니다.