LLM 온도(temperature) 파라미터 완전 이해: 소프트맥스 샘플링과 창의성 조절 원리
대형언어모델이 같은 질문에도 매번 다른 문장을 만드는 이유는 확률에 따라 단어를 뽑기 때문이다. 로짓과 소프트맥스가 확률을 만드는 과정, 온도 파라미터가 그 분포를 어떻게 뾰족하거나 평평하게 바꾸는지, 물리학에서 유래한 이름의 뜻까지 정리했다.
핵심 내용 읽기 →AI TOPIC
소프트맥스 관련 핵심 뉴스와 활용 인사이트 8편을 최신순으로 모았습니다.

대형언어모델이 같은 질문에도 매번 다른 문장을 만드는 이유는 확률에 따라 단어를 뽑기 때문이다. 로짓과 소프트맥스가 확률을 만드는 과정, 온도 파라미터가 그 분포를 어떻게 뾰족하거나 평평하게 바꾸는지, 물리학에서 유래한 이름의 뜻까지 정리했다.
핵심 내용 읽기 →
소프트맥스는 단순히 점수를 확률로 바꾸는 함수가 아니다. 지수함수와 음의 로그가능도를 짝지었을 때 기울기가 '예측 확률에서 정답 벡터를 뺀 값'이라는 한 줄로 정리되는 이유를, 신경망 학습 과정을 따라가며 차근차근 풀어본다.
핵심 내용 읽기 →
스탠퍼드 CS229 4강은 여러 확률분포를 지수족이라는 한 가지 형태로 묶어 추론과 학습 절차를 통일하고, 소프트맥스와 교차 엔트로피가 오늘의 AI가 다음 토큰을 고르는 마지막 층임을 보여준다. 강의 핵심을 정리했다.
핵심 내용 읽기 →
언어 모델의 토큰 생성부터 이미지 생성, 분류, 회귀, 강화학습까지 모두 확률 분포에서의 샘플링으로 설명된다. AI를 결정론이 아닌 분포로 보는 멘탈 모델을 소개한다.
핵심 내용 읽기 →
스탠퍼드 CS229 강의를 따라 로지스틱 회귀를 한 개짜리 뉴런으로 보고, 다중 클래스 소프트맥스, 은닉층과 완전연결, 행렬 형태와 브로드캐스팅, 순전파·역전파와 연쇄법칙까지 신경망의 기초를 정리한다.
핵심 내용 읽기 →
안드레이 카파시의 GPT 직접 만들기 강의 전반부에 나오는 바이그램 언어 모델을 셰익스피어 데이터 예제로 풀어, 토큰·임베딩 표·손실·소프트맥스 개념을 정리한다.
핵심 내용 읽기 →
GPT의 G·P·T가 무엇인지부터 단어 임베딩, 내적 유사도, 소프트맥스와 온도까지. 트랜스포머가 다음 단어를 예측하는 과정을 시각적으로 설명한다.
핵심 내용 읽기 →
활성화 함수가 신경망에 비선형성을 더하는 원리부터, 시그모이드의 기울기 소실, ReLU의 죽은 뉴런 문제와 Leaky ReLU 같은 해결책, 분류에 쓰는 출력층 소프트맥스까지 핵심 개념을 초보자도 이해하기 쉽게 정리했습니다.
핵심 내용 읽기 →