CUDA 행렬곱 최적화 단계별 정리: 타일링부터 텐서코어와 CUTLASS 추상화까지
GPU 행렬곱 커널을 가장 느린 형태부터 직접 고쳐 나가며 cuBLAS 성능에 다가간 기록이다. 메모리 접근 정렬, 타일링, 벡터화 로드, 텐서코어, 더블 버퍼링을 거쳐 CUTLASS가 왜 필요한지 짚는다.
핵심 내용 읽기 →AI TOPIC
행렬곱 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

GPU 행렬곱 커널을 가장 느린 형태부터 직접 고쳐 나가며 cuBLAS 성능에 다가간 기록이다. 메모리 접근 정렬, 타일링, 벡터화 로드, 텐서코어, 더블 버퍼링을 거쳐 CUTLASS가 왜 필요한지 짚는다.
핵심 내용 읽기 →
GPU MODE 강연에서 Colfax 연구팀이 CuTe 레이아웃의 모양과 스트라이드, 합성·여집합·논리적 분할을 차례로 정리하고, 이를 범주론의 튜플 사상으로 바꿔 계산하는 방법과 남은 과제까지 짚었다.
핵심 내용 읽기 →