트라이톤으로 HPC GPU 커널 이식성 해결하기: 파이썬 의존을 걷어낸 AOT 컴파일 실험
노스캐롤라이나 주립대 연구진이 AI 생태계가 키운 GPU 언어 트라이톤을 슈퍼컴퓨팅 환경으로 옮긴 방법을 공개했다. 파이썬 의존을 걷어내 오브젝트 파일처럼 링크하는 구조와 함께, 불규칙 워크로드에서 성능이 무너지는 한계까지 솔직하게 짚었다.
핵심 내용 읽기 →AI TOPIC
GPU 커널 관련 핵심 뉴스와 활용 인사이트 6편을 최신순으로 모았습니다.

노스캐롤라이나 주립대 연구진이 AI 생태계가 키운 GPU 언어 트라이톤을 슈퍼컴퓨팅 환경으로 옮긴 방법을 공개했다. 파이썬 의존을 걷어내 오브젝트 파일처럼 링크하는 구조와 함께, 불규칙 워크로드에서 성능이 무너지는 한계까지 솔직하게 짚었다.
핵심 내용 읽기 →
16비트에서 4비트로 내려가면 행렬 곱 처리량은 네 배가 되지만 양자화 오차가 학습을 망친다. GPU MODE 강연에서 연구진이 무작위 회전으로 무편향 그래디언트를 얻어낸 NVFP4 학습 기법과 커널 구현을 공개했다.
핵심 내용 읽기 →
GPU MODE 강연에서 Colfax 연구팀이 CuTe 레이아웃의 모양과 스트라이드, 합성·여집합·논리적 분할을 차례로 정리하고, 이를 범주론의 튜플 사상으로 바꿔 계산하는 방법과 남은 과제까지 짚었다.
핵심 내용 읽기 →
허깅페이스 커널 프로젝트는 GPU 커널의 빌드·배포·사용 방식을 표준화해, 파이토치 버전과 하드웨어 조합마다 직접 컴파일해야 했던 부담을 덜어준다. GPU MODE 강연에서 설계 원리와 보안·향후 계획을 정리했다.
핵심 내용 읽기 →
CMU 박사과정 보한 허우가 GPU MODE 강연에서 커널 언어 TIRx를 소개했다. 스레드 수준 제어와 타일 문법을 함께 두고 컴파일러 단계를 줄여, 새 GPU 세대의 기능을 빠르게 노출하려는 설계를 설명한다.
핵심 내용 읽기 →
스탠퍼드 CS336 초청 강연에서 댄 푸가 언어모델 추론의 작동 방식, 프리필·디코드와 KV 캐시, 메가 커널과 루프 트랜스포머 PARSE 연구를 설명했다.
핵심 내용 읽기 →