안드레이 카파시 makemore 5편, 웨이브넷 계층 구조로 문자 언어 모델 손실 낮추기
안드레이 카파시가 makemore 5편에서 다층 퍼셉트론을 웨이브넷식 계층 구조로 바꾸고 문맥을 8자로 늘린 뒤 배치 정규화 버그까지 잡아 검증 손실을 2.10에서 1.993으로 낮추는 과정을 정리했다.
핵심 내용 읽기 →AI TOPIC
배치 정규화 관련 핵심 뉴스와 활용 인사이트 5편을 최신순으로 모았습니다.

안드레이 카파시가 makemore 5편에서 다층 퍼셉트론을 웨이브넷식 계층 구조로 바꾸고 문맥을 8자로 늘린 뒤 배치 정규화 버그까지 잡아 검증 손실을 2.10에서 1.993으로 낮추는 과정을 정리했다.
핵심 내용 읽기 →
안드레이 카파시의 makemore 4편 강의를 정리했다. 자동미분을 끄고 역전파를 텐서 수준에서 손으로 구현하며 얻는 디버깅 감각, 그리고 교차엔트로피와 배치정규화를 한 줄로 줄이는 해석적 미분식을 다룬다.
핵심 내용 읽기 →
안드레이 카파시가 makemore 세 번째 강의에서 초기 손실값 27이 왜 잘못된 신호인지, tanh 포화가 어떻게 기울기를 죽이는지, 배치 정규화가 무엇을 해결하고 무엇을 대가로 치르는지 짚는다.
핵심 내용 읽기 →
배치 노름과 레이어 노름은 신경망 값을 안정시키는 같은 목표를 갖지만 어느 축으로 평균을 내는가가 다르다. 트랜스포머가 가변 길이 패딩과 작은 배치, 토큰 단위 추론 때문에 배치 노름을 버리고 레이어 노름을 택한 이유를 쉽게 정리했다.
핵심 내용 읽기 →
딥러닝 신경망에서 자주 발생하는 불안정한 기울기 문제를 해결하고 학습 속도를 끌어올리는 배치 정규화의 작동 원리와 표준화·스케일·오프셋 과정, 그리고 케라스로 한 줄에 구현하는 방법과 활성화 함수 앞뒤 배치 선택까지 쉽게 정리했습니다.
핵심 내용 읽기 →