M1 Apple Neural Engine 분석은 트랜스포머 연산이 가능해도 CNN의 가중치 재사용에 맞춘 데이터 경로가 LLM 디코딩에 불리하다고 설명합니다. 실험에서 가중치 읽기는 약 38GB/s, 입력 읽기는 59GB/s로 GPU의 약 78GB/s보다 낮았고 두 경로의 전송 시간도 겹치지 않았습니다. 토큰마다 큰 가중치를 읽는 작업에는 대역폭이 병목이므로 드라이버 공개나 연산량 증가만으로 해결하기 어렵습니다. M1의 특정 실험을 모든 세대의 절대 성능으로 볼 수는 없습니다.