AI 칩 아키텍처 자료는 단일 스레드 CPU 성능 증가율이 크게 둔화된 뒤 GPU, TPU, AMD Instinct, Cerebras WSE, AWS Trainium과 Groq LPU가 서로 다른 데이터 이동 구조로 경쟁하는 흐름을 정리합니다. Transformer 학습과 prefill은 연산 밀도가 높고 토큰 생성은 메모리 대역폭의 영향을 크게 받습니다. 모델 단계와 배치 크기에 따라 적합한 가속기가 달라 단일 벤치마크만으로 선택하기 어렵습니다.
Tech로 돌아가기
Tech
AI 칩의 차이는 연산량보다 데이터 이동 방식에서 갈립니다
AI 가속기는 최고 연산량보다 학습, prefill, 생성 단계의 데이터 이동과 메모리 병목에 맞춰 선택해야 합니다.