그래디언트 누적이란? GPU 메모리 부족에서도 큰 배치 효과를 내는 딥러닝 학습 기법
큰 배치는 학습을 안정시키지만 GPU 메모리에 한꺼번에 다 올리지 못할 때가 많다. 작은 마이크로배치의 경사를 합산해 큰 배치 효과를 내는 그래디언트 누적의 원리와 PyTorch 구현 순서를 정리했다.
핵심 내용 읽기 →AI TOPIC
딥러닝학습 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

큰 배치는 학습을 안정시키지만 GPU 메모리에 한꺼번에 다 올리지 못할 때가 많다. 작은 마이크로배치의 경사를 합산해 큰 배치 효과를 내는 그래디언트 누적의 원리와 PyTorch 구현 순서를 정리했다.
핵심 내용 읽기 →
역전파가 구한 그래디언트로 손실의 최솟값을 어떻게 찾을까. SGD의 학습률 문제부터 모멘텀, 학습률을 매개변수별로 적응시키는 아다그라드·RMSProp, 그리고 둘을 결합한 Adam까지 주요 최적화 알고리즘을 풀어봤다.
핵심 내용 읽기 →