AI 칩 아키텍처 자료는 단일 스레드 CPU 성능 증가율이 크게 둔화된 뒤 GPU, TPU, AMD Instinct, Cerebras WSE, AWS Trainium과 Groq LPU가 서로 다른 데이터 이동 구조로 경쟁하는 흐름을 정리합니다. Transformer 학습과 prefill은 연산 밀도가 높고 토큰 생성은 메모리 대역폭의 영향을 크게 받습니다. 모델 단계와 배치 크기에 따라 적합한 가속기가 달라 단일 벤치마크만으로 선택하기 어렵습니다.