확률적 동적 계획법과 마르코프 결정 과정: 스탠퍼드 AA203 9강의 벨만 재귀와 Q 함수 정리
스탠퍼드 AA203 9강은 외란이 섞인 제어 문제를 마르코프 결정 과정으로 세우고, 기댓값 기반 벨만 재귀와 창고 재고 예제, 확률적 LQR, 무한 구간 MDP와 Q 함수까지 이어지는 흐름을 차례로 정리한다.
핵심 내용 읽기 →AI TOPIC
마르코프 결정 과정 관련 핵심 뉴스와 활용 인사이트 4편을 최신순으로 모았습니다.

스탠퍼드 AA203 9강은 외란이 섞인 제어 문제를 마르코프 결정 과정으로 세우고, 기댓값 기반 벨만 재귀와 창고 재고 예제, 확률적 LQR, 무한 구간 MDP와 Q 함수까지 이어지는 흐름을 차례로 정리한다.
핵심 내용 읽기 →
4족 보행 로봇부터 드론까지 서로 다른 로봇을 하나의 언어로 다루는 강체와 좌표계, 순기구학과 역기구학의 기초부터 이를 학습 문제로 바꾸는 마르코프 결정 과정까지 ETH 취리히 강의 내용을 정리했다.
핵심 내용 읽기 →
강화학습이 회로 설계와 핵융합 제어 같은 산업 현장에 쓰이기 시작한 배경, 그리고 마르코프 결정 과정·정책·수익·가치 함수라는 네 가지 기본 개념이 어떻게 맞물려 최적 행동을 찾아내는지 정리했다. 이 틀에 깔린 강한 가정도 함께 짚는다.
핵심 내용 읽기 →
신발끈 묶기처럼 규칙을 일일이 지정할 수 없는 과제를 시행착오로 배우는 강화학습을, 마르코프 결정 과정·몬테카를로·시간차·Q러닝·딥 Q네트워크·정책 경사와 뇌의 도파민 연구까지 한 흐름으로 정리했다.
핵심 내용 읽기 →