GPU 구조와 플래시 어텐션 원리: 산술 강도·타일링·커널 퓨전으로 LLM 학습 속도를 끌어올리는 법
대학 LLM 강의가 GPU 내부 구조부터 차근히 짚었다. 연산 성능은 폭증했지만 메모리 대역폭이 따라오지 못했고, 그 격차를 메우려 나온 다섯 가지 최적화 기법이 한데 모여 플래시 어텐션이 됐다는 설명이다.
핵심 내용 읽기 →AI TOPIC
메모리 대역폭 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

대학 LLM 강의가 GPU 내부 구조부터 차근히 짚었다. 연산 성능은 폭증했지만 메모리 대역폭이 따라오지 못했고, 그 격차를 메우려 나온 다섯 가지 최적화 기법이 한데 모여 플래시 어텐션이 됐다는 설명이다.
핵심 내용 읽기 →
인텔 NUC 미니 PC 3대를 묶어 한 대로는 못 담는 70B 밀집 모델을 돌린 실험이다. 모델을 쪼개면 오히려 느려지지만 크기 문제는 풀렸고, 속도의 진짜 병목은 메모리 대역폭이었다. 크기와 속도는 서로 다른 클러스터 전략으로 풀어야 한다.
핵심 내용 읽기 →