TLX로 GPU 커널 최적화하기: Triton 확장으로 워프 특화·파이프라이닝·공유메모리 직접 제어
메타가 공개한 Triton 확장 TLX 강연을 정리했다. 타일 중심 모델은 그대로 두면서 파이프라이닝과 워프 특화, 공유메모리 관리, 2-CTA 모드를 직접 제어해 cuBLAS급 성능에 접근하는 기법을 사례로 살펴본다.
핵심 내용 읽기 →AI TOPIC
커널 최적화 관련 핵심 뉴스와 활용 인사이트 4편을 최신순으로 모았습니다.

메타가 공개한 Triton 확장 TLX 강연을 정리했다. 타일 중심 모델은 그대로 두면서 파이프라이닝과 워프 특화, 공유메모리 관리, 2-CTA 모드를 직접 제어해 cuBLAS급 성능에 접근하는 기법을 사례로 살펴본다.
핵심 내용 읽기 →
Triton을 키운 개발팀이 Blackwell 세대 GPU를 위해 내놓은 저수준 커널 언어 Gluon, 그 바탕이 되는 선형 레이아웃 수학, 그리고 cuBLAS와 대등한 행렬곱을 만들어낸 최적화 기법을 정리했다.
핵심 내용 읽기 →
스탠퍼드와 AMD가 함께 만든 커널 라이브러리 HipKittens 개발자가 AMD GPU의 하드웨어 특성과 컴파일러 한계, 메모리 이동·점유율·캐시 재사용이라는 세 축의 최적화를 강연에서 풀어냈다.
핵심 내용 읽기 →
Y Combinator 페이퍼 클럽이 커널과 칩을 주제로 다섯 개 발표를 모았다. 멀티 GPU 네트워킹이 새 병목이 됐다는 진단부터 질의의 88.7%를 로컬 가속기로 넘길 수 있다는 측정, AI가 만든 커널에서 반복 발견된 보상 해킹 사례까지 짚었다.
핵심 내용 읽기 →