AMUSE 논문 리뷰: 샤프니스와 리버 밸리 관점으로 본 Muon·스케줄 프리 옵티마이저
KAIST 연구실에서 나온 옵티마이저 논문 AMUSE를 소개하는 발표를 정리했다. 샤프니스와 엣지 오브 스태빌리티, 도미넌트·벌크 부분공간, 리버 밸리 손실 지형이라는 관점으로 Muon과 스케줄 프리 방식의 강점을 차례로 설명한다.
핵심 내용 읽기 →AI TOPIC
딥러닝 최적화 관련 핵심 뉴스와 활용 인사이트 4편을 최신순으로 모았습니다.

KAIST 연구실에서 나온 옵티마이저 논문 AMUSE를 소개하는 발표를 정리했다. 샤프니스와 엣지 오브 스태빌리티, 도미넌트·벌크 부분공간, 리버 밸리 손실 지형이라는 관점으로 Muon과 스케줄 프리 방식의 강점을 차례로 설명한다.
핵심 내용 읽기 →
제인스트리트 엔지니어들이 GPU 학습을 느리게 만드는 세 가지 병목을 짚었다. 숨은 CPU-GPU 동기화와 메모리 대역폭, 커널 실행 오버헤드를 프로파일러로 찾아내고 커스텀 커널로 20밀리초를 30마이크로초까지 줄인 과정을 정리했다.
핵심 내용 읽기 →
TTIC 연구 발표에서 즈위안 리 교수가 Adam이 SGD보다 빠른 이유를 좌표축에 묶인 기하로 설명하고, 스펙트럴 노름을 쓰는 Muon과 적응형 매끄러움 개념까지 딥러닝 최적화 이론의 최신 지형을 정리했다.
핵심 내용 읽기 →
트랜스포머의 어텐션을 수 배 빠르게 만드는 플래시 어텐션의 원리를 정리했다. 어텐션의 O(N제곱) 병목, GPU 메모리 계층, 온라인 소프트맥스, 그리고 대역폭 한계를 이용한 커널 융합을 쉽게 설명한다.
핵심 내용 읽기 →