FSDP 분산 학습 입문, 파라미터 샤딩과 all-gather·reduce-scatter 그리고 Ray Train
모델이 GPU 한 장에 담기지 않을 때 쓰는 FSDP의 두 단계 분할과 all-gather·reduce-scatter가 만드는 통신 비용, FSDP2 실습 설정, 그리고 학습 로직과 분산 실행을 나누는 Ray Train의 역할을 정리했다.
핵심 내용 읽기 →AI TOPIC
Ray 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

모델이 GPU 한 장에 담기지 않을 때 쓰는 FSDP의 두 단계 분할과 all-gather·reduce-scatter가 만드는 통신 비용, FSDP2 실습 설정, 그리고 학습 로직과 분산 실행을 나누는 Ray Train의 역할을 정리했다.
핵심 내용 읽기 →
캐피털원 엔지니어들이 쿠버네티스 위에서 Ray 클러스터를 운영하며 겪은 데이터 로딩 병목과 자동·수동 샤딩 선택, 시행 한 건당 시간을 3분의 1로 줄인 과정을 Ray 서밋 발표 자막을 근거로 정리했습니다.
핵심 내용 읽기 →