Dion2 옵티마이저 공개 - 무온(Muon)의 직교화 비용을 줄여 대규모 학습을 확장하는 방법
마이크로소프트 리서치가 무온(Muon) 옵티마이저의 직교화 병목을 줄인 Dion2를 공개했다. 업데이트 행렬에서 노름이 큰 일부 행만 골라 직교화해 연산과 통신을 줄이면서도 학습 품질은 그대로 유지한다.
핵심 내용 읽기 →AI TOPIC
옵티마이저 관련 핵심 뉴스와 활용 인사이트 8편을 최신순으로 모았습니다.

마이크로소프트 리서치가 무온(Muon) 옵티마이저의 직교화 병목을 줄인 Dion2를 공개했다. 업데이트 행렬에서 노름이 큰 일부 행만 골라 직교화해 연산과 통신을 줄이면서도 학습 품질은 그대로 유지한다.
핵심 내용 읽기 →
AI 안전 교육 프로그램 ARENA의 신경망 학습 강의를 정리했다. SGD와 모멘텀, Adam 옵티마이저의 작동 원리부터 하이퍼파라미터 자동 탐색 도구 활용법, 그리고 데이터·파이프라인·텐서 병렬 분산 학습 세 방식의 차이와 한계까지 짚는다.
핵심 내용 읽기 →
10년째 AdamW가 지배해 온 LLM 학습에 마이크로소프트 리서치가 회전이라는 관점을 들고 나왔다. 기존 행렬 옵티마이저를 하나로 설명하면서 더 적은 데이터로 같은 손실에 도달하는 ARO를 정리했다.
핵심 내용 읽기 →
KAIST 연구실에서 나온 옵티마이저 논문 AMUSE를 소개하는 발표를 정리했다. 샤프니스와 엣지 오브 스태빌리티, 도미넌트·벌크 부분공간, 리버 밸리 손실 지형이라는 관점으로 Muon과 스케줄 프리 방식의 강점을 차례로 설명한다.
핵심 내용 읽기 →
GPU MODE 강연이 소개한 원 레이어 디퍼 대회는 훈련 때보다 더 깊은 연산을 요구하는 반복 모듈러 제곱 문제를 내걸고, H100 한 장이라는 제약 아래 잠재 공간 반복과 옵티마이저 설계를 겨루게 한다.
핵심 내용 읽기 →
머신러닝 학습의 핵심인 옵티마이저를, 기본 SGD와 모멘텀·NAG, 파라미터별 학습률의 RMSprop을 거쳐 Adam까지 수학적 직관과 벤치마크, 강화학습 사례를 곁들여 단계별로 쉽고 자세하게 설명합니다.
핵심 내용 읽기 →
10년간 딥러닝 학습을 지배한 Adam의 한계를 짚고, 가중치 행렬의 구조를 직접 활용해 업데이트를 직교화하는 새 옵티마이저 Muon의 원리와 대규모 모델에서의 연산 효율·QK-clip 안정화 기법까지 정리했다.
핵심 내용 읽기 →
역전파가 구한 그래디언트로 손실의 최솟값을 어떻게 찾을까. SGD의 학습률 문제부터 모멘텀, 학습률을 매개변수별로 적응시키는 아다그라드·RMSProp, 그리고 둘을 결합한 Adam까지 주요 최적화 알고리즘을 풀어봤다.
핵심 내용 읽기 →