소프트맥스 원리 정리: 신경망이 지수함수를 쓰는 진짜 이유와 교차 엔트로피 기울기 계산
소프트맥스는 단순히 점수를 확률로 바꾸는 함수가 아니다. 지수함수와 음의 로그가능도를 짝지었을 때 기울기가 '예측 확률에서 정답 벡터를 뺀 값'이라는 한 줄로 정리되는 이유를, 신경망 학습 과정을 따라가며 차근차근 풀어본다.
핵심 내용 읽기 →AI TOPIC
교차엔트로피 관련 핵심 뉴스와 활용 인사이트 4편을 최신순으로 모았습니다.

소프트맥스는 단순히 점수를 확률로 바꾸는 함수가 아니다. 지수함수와 음의 로그가능도를 짝지었을 때 기울기가 '예측 확률에서 정답 벡터를 뺀 값'이라는 한 줄로 정리되는 이유를, 신경망 학습 과정을 따라가며 차근차근 풀어본다.
핵심 내용 읽기 →
세바스찬 라시카가 GPT 모델을 밑바닥부터 사전학습하는 과정을 공개했다. 교차 엔트로피 손실 계산부터 학습·검증 손실 추적, 온도 조절과 top-k 샘플링, 오픈AI GPT-2 가중치 이식까지 단계별로 다룬다.
핵심 내용 읽기 →
초창기 연구자들은 신경망이 지역 최솟값에 갇힐 것이라며 경사하강법을 외면했다. 라마 모델의 손실 지형을 직접 그려 보며 왜 그 예측이 빗나갔는지, 고차원 공간에서 학습이 실제로 어떻게 일어나는지 살펴본다.
핵심 내용 읽기 →
라벨 스무딩이 원-핫 정답 벡터를 살짝 부드럽게 만들어 모델의 과잉 확신과 과적합을 줄이는 원리를 설명한다. 교차 엔트로피·최대 가능도와의 관계, 스무딩 정도 알파의 선택, 파이토치에서의 한 줄 적용법까지 차근차근 정리했다.
핵심 내용 읽기 →