강화학습 기초 정리: MDP와 보상 설계, 정책 경사(REINFORCE)까지 스탠퍼드 CS229 강의
스탠퍼드 CS229 강의가 강화학습의 기본기를 정리했다. 상태·행동·전이·보상으로 세계를 기술하는 MDP와 할인 계수, 보상 설계에 숨은 함정, 그리고 대형 언어 모델 학습의 출발점이 되는 정책 경사 알고리즘까지 짚는다.
핵심 내용 읽기 →AI TOPIC
스탠퍼드 CS229 관련 핵심 뉴스와 활용 인사이트 8편을 최신순으로 모았습니다.

스탠퍼드 CS229 강의가 강화학습의 기본기를 정리했다. 상태·행동·전이·보상으로 세계를 기술하는 MDP와 할인 계수, 보상 설계에 숨은 함정, 그리고 대형 언어 모델 학습의 출발점이 되는 정책 경사 알고리즘까지 짚는다.
핵심 내용 읽기 →
정책 경사의 직관과 기준값으로 분산을 줄이는 방법, PPO가 옛 표본을 재사용하며 확률 비율을 잘라내는 이유, 그리고 정답 일치 여부만으로 보상을 주어 긴 사고 과정을 학습시키는 방식까지 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS229 2026년 봄학기 9강은 k-평균이 왜 반드시 멈추면서도 최적해를 놓치는지, 군집 개수 K를 고르는 일이 왜 통계가 아니라 모델링 결정인지를 짚고, 확률로 배분하는 가우시안 혼합모델로 넘어간다.
핵심 내용 읽기 →
스탠퍼드 CS229 2026년 봄학기 5강은 생성모델의 가장 단순한 형태인 가우시안 판별분석과 나이브 베이즈를 다루며, 데이터 분포 자체를 모형화하는 접근이 왜 지난 10년 AI 진보의 축이 됐는지를 짚었다.
핵심 내용 읽기 →
스탠퍼드 CS229 4강은 여러 확률분포를 지수족이라는 한 가지 형태로 묶어 추론과 학습 절차를 통일하고, 소프트맥스와 교차 엔트로피가 오늘의 AI가 다음 토큰을 고르는 마지막 층임을 보여준다. 강의 핵심을 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS229 2026년 봄학기 1강이 공개됐다. AI 도구 사용 규칙, 1959년과 1998년의 머신러닝 정의, 지도·비지도·강화학습의 구분과 한 학기 강의 지도를 강사가 직접 훑었다. 여전히 전통적인 접근을 유지하는 이유도 함께 설명했다.
핵심 내용 읽기 →
스탠퍼드 CS229 강의를 따라 로지스틱 회귀를 한 개짜리 뉴런으로 보고, 다중 클래스 소프트맥스, 은닉층과 완전연결, 행렬 형태와 브로드캐스팅, 순전파·역전파와 연쇄법칙까지 신경망의 기초를 정리한다.
핵심 내용 읽기 →
앤드루 응이 진행한 스탠퍼드 CS229 머신러닝 첫 강의를 정리했다. AI는 새로운 전기라는 비유부터 머신러닝의 두 가지 정의, 지도학습의 회귀와 분류, 비지도학습, 그리고 체계적인 학습 전략까지 핵심 개념을 두루 담았다.
핵심 내용 읽기 →