강화학습 기초 정리: 탐색과 활용, 마르코프 결정 과정, 벨만 방정식과 Q값까지 한 번에
AI 안전 교육 프로그램 ARENA의 강화학습 입문 강의를 정리했다. 지도학습과 무엇이 다른지부터 밴딧 문제의 탐색과 활용, 마르코프 결정 과정, 벨만 방정식과 정책 반복, Q값의 쓸모까지 차례로 짚는다.
핵심 내용 읽기 →AI TOPIC
벨만방정식 관련 핵심 뉴스와 활용 인사이트 4편을 최신순으로 모았습니다.

AI 안전 교육 프로그램 ARENA의 강화학습 입문 강의를 정리했다. 지도학습과 무엇이 다른지부터 밴딧 문제의 탐색과 활용, 마르코프 결정 과정, 벨만 방정식과 정책 반복, Q값의 쓸모까지 차례로 짚는다.
핵심 내용 읽기 →
강화학습 강의 시리즈 2편을 정리했다. 벨만 방정식이 상태값을 어떻게 연결하는지, 정책 평가와 정책 개선이 왜 번갈아 돌아가며 최적 정책에 도달하는지, 그리고 그 틀이 왜 대부분의 강화학습 알고리즘을 설명하는지 짚는다.
핵심 내용 읽기 →
스티브 브런턴 교수가 100년 역사의 강화학습을 모델 기반과 모델 프리, 경사 기반과 경사 프리, 온·오프 정책으로 나눠 전체 지형도를 그린다. 벨만 방정식부터 딥 Q러닝까지의 큰 그림.
핵심 내용 읽기 →
강화학습은 상황을 행동에 매핑해 보상을 최대화하는 학습이다. 가치 기반 방법과 정책 기반 방법의 차이, 상태 가치 함수 V와 상태 행동 가치 함수 Q, 그리고 가치 함수를 재귀적으로 계산하는 벨만 방정식의 직관을 그리드 예제로 정리했다.
핵심 내용 읽기 →