확률적 동적 계획법과 마르코프 결정 과정: 스탠퍼드 AA203 9강의 벨만 재귀와 Q 함수 정리
스탠퍼드 AA203 9강은 외란이 섞인 제어 문제를 마르코프 결정 과정으로 세우고, 기댓값 기반 벨만 재귀와 창고 재고 예제, 확률적 LQR, 무한 구간 MDP와 Q 함수까지 이어지는 흐름을 차례로 정리한다.
핵심 내용 읽기 →AI TOPIC
동적계획법 관련 핵심 뉴스와 활용 인사이트 4편을 최신순으로 모았습니다.

스탠퍼드 AA203 9강은 외란이 섞인 제어 문제를 마르코프 결정 과정으로 세우고, 기댓값 기반 벨만 재귀와 창고 재고 예제, 확률적 LQR, 무한 구간 MDP와 Q 함수까지 이어지는 흐름을 차례로 정리한다.
핵심 내용 읽기 →
스탠퍼드 AA203 10강은 무한 시간 MDP의 가치 반복과 정책 반복을 마무리한 뒤, 연속시간 벨만 방정식인 HJB와 외란을 상대하는 HJI 방정식, 충돌 회피에 쓰이는 도달가능집합까지 이어서 설명한다.
핵심 내용 읽기 →
스탠퍼드 AA203 7강 정리. 개루프 제어와 폐루프 정책의 차이, 최적성 원리와 역방향 재귀, 차원의 저주, LQR이 리카티 방정식으로 정리되는 과정을 한국어로 차근차근 풀어 설명한다.
핵심 내용 읽기 →
강화학습 강의 시리즈 2편을 정리했다. 벨만 방정식이 상태값을 어떻게 연결하는지, 정책 평가와 정책 개선이 왜 번갈아 돌아가며 최적 정책에 도달하는지, 그리고 그 틀이 왜 대부분의 강화학습 알고리즘을 설명하는지 짚는다.
핵심 내용 읽기 →