PPO 강화학습 강의 정리 – 정책 경사, 어드밴티지, 중요도 샘플링과 클리핑까지 단계별 해설
AI 안전 교육 과정 ARENA의 PPO 강의를 정리했다. 바닐라 정책 경사에서 출발해 리워드 투 고, 어드밴티지와 크리틱, 적격 흔적, 중요도 샘플링과 비율 클리핑, 엔트로피 보너스까지 각 항이 왜 필요한지 짚는다.
핵심 내용 읽기 →AI TOPIC
액터 크리틱 관련 핵심 뉴스와 활용 인사이트 5편을 최신순으로 모았습니다.

AI 안전 교육 과정 ARENA의 PPO 강의를 정리했다. 바닐라 정책 경사에서 출발해 리워드 투 고, 어드밴티지와 크리틱, 적격 흔적, 중요도 샘플링과 비율 클리핑, 엔트로피 보너스까지 각 항이 왜 필요한지 짚는다.
핵심 내용 읽기 →
스탠퍼드 AA203 18강은 가치 함수를 거치지 않고 정책 자체를 직접 최적화하는 정책 경사를 다룬다. 리인포스 알고리즘의 유도, 높은 분산 문제, 인과성과 베이스라인을 통한 분산 감소, 액터-크리틱과 어드밴티지 함수까지 정리했다.
핵심 내용 읽기 →
ETH 취리히 로봇 학습 강의 5회차를 정리했다. 정책 경사 정리의 유도부터 인과성과 베이스라인으로 분산을 줄이는 과정, 중요도 샘플링과 TRPO·PPO의 차이, 그리고 소프트 액터 크리틱까지 차례로 이어진다.
핵심 내용 읽기 →
Q러닝, 정책 경사, 액터 크리틱을 따로 공부해도 연결되지 않는다면 순서가 문제일 수 있다. 모든 강화학습 알고리즘이 반드시 답해야 하는 여섯 가지 질문을 기준으로 탐색과 활용, TD와 몬테카를로, 어드밴티지까지 전체 지형을 정리했다.
핵심 내용 읽기 →
강화학습의 액터-크리틱 방법을 마르코프 결정 과정부터 시간차 학습까지 단계별로 풀어 설명한다. 행동을 정하는 정책망과 상태를 평가하는 가치망이 어떻게 협력하는지, 손실은 어떻게 계산하는지, 왜 불안정한지를 정리했다.
핵심 내용 읽기 →