CUDA 행렬곱 최적화 단계별 정리: 타일링부터 텐서코어와 CUTLASS 추상화까지
GPU 행렬곱 커널을 가장 느린 형태부터 직접 고쳐 나가며 cuBLAS 성능에 다가간 기록이다. 메모리 접근 정렬, 타일링, 벡터화 로드, 텐서코어, 더블 버퍼링을 거쳐 CUTLASS가 왜 필요한지 짚는다.
핵심 내용 읽기 →AI TOPIC
텐서코어 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

GPU 행렬곱 커널을 가장 느린 형태부터 직접 고쳐 나가며 cuBLAS 성능에 다가간 기록이다. 메모리 접근 정렬, 타일링, 벡터화 로드, 텐서코어, 더블 버퍼링을 거쳐 CUTLASS가 왜 필요한지 짚는다.
핵심 내용 읽기 →
GPU와 CPU의 차이를 주방에 비유해 풀어낸 해설. CUDA 코어와 텐서 코어의 역할, 메모리 대역폭이 진짜 병목인 이유, 게임 렌더링과 AI 학습이 같은 수학 문제인 이유, 엔비디아 CUDA 생태계의 힘까지 정리했다.
핵심 내용 읽기 →