FSDP 분산 학습 입문, 파라미터 샤딩과 all-gather·reduce-scatter 그리고 Ray Train
모델이 GPU 한 장에 담기지 않을 때 쓰는 FSDP의 두 단계 분할과 all-gather·reduce-scatter가 만드는 통신 비용, FSDP2 실습 설정, 그리고 학습 로직과 분산 실행을 나누는 Ray Train의 역할을 정리했다.
핵심 내용 읽기 →AI TOPIC
FSDP 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

모델이 GPU 한 장에 담기지 않을 때 쓰는 FSDP의 두 단계 분할과 all-gather·reduce-scatter가 만드는 통신 비용, FSDP2 실습 설정, 그리고 학습 로직과 분산 실행을 나누는 Ray Train의 역할을 정리했다.
핵심 내용 읽기 →
대규모 언어 모델 학습 인프라를 만드는 엔지니어가 버클리 강연에서 풀어놓은 분산 학습의 기본기를 정리했다. 데이터·파이프라인·텐서 병렬의 원리와 한계, 그리고 FSDP와 제로가 메모리 벽을 어떻게 우회하는지 살펴본다.
핵심 내용 읽기 →