AI VIDEO BRIEFING
심층 강화학습 기초 정리: 스탠퍼드 CS224R 1강이 설명하는 상태·행동·보상과 정책
스탠퍼드 CS224R 첫 강의에서 첼시 핀 교수가 강화학습이 지도학습과 갈라지는 지점, 상태와 관측의 차이, 궤적과 보상 함수, 확률적 정책과 가치 함수까지 로봇과 대화 모델 예시를 들어 차근차근 정리했다.

핵심 메시지
쉽게 이해하기
스탠퍼드 대학원 과목 CS224R의 첫 강의 영상이다. 강화학습과 로봇공학, 언어 모델을 연구하는 첼시 핀 교수가 강의를 맡았고, 이날은 과목의 범위를 소개한 뒤 행동을 데이터로 표현하는 법과 강화학습 문제를 세우는 법까지 다룬다.
강의는 지도학습과의 차이를 명확히 하는 데서 출발한다. 지도학습은 입력과 정답 쌍이 동일한 분포에서 독립적으로 뽑혔다고 가정하지만, 강화학습은 상태에서 행동으로 가는 함수를 배우고 그 데이터가 지금 학습 중인 정책에서 나온다. 정답이 주어지지 않고 훨씬 간접적인 신호로 배운다는 점, 그리고 데이터 분포가 학습에 따라 움직인다는 점이 핵심 차이로 제시된다.
왜 배워야 하는지에 대해서는 여러 사례가 나열된다. 음악 추천처럼 예측이 다음 상황을 바꾸는 문제, 코딩 도우미에 주는 잘함·못함 피드백처럼 정답 형태가 아닌 감독, 다리 달린 로봇의 보행과 빨래 개기, 바둑에서 사람이 생각하지 못한 수를 찾아낸 사례, 최신 언어 모델의 후처리, 교통 흐름 제어와 칩 설계까지 이어진다. 강연자는 경험에서 배우는 능력이 지능의 본질에 가깝다는 점도 이유로 든다.
본론은 표기법 정리다. 상태와 관측, 행동, 그리고 이들의 나열인 궤적, 상태와 행동이 얼마나 좋은지를 알려주는 보상 함수가 차례로 정의된다. 다음 상태가 직전 상태와 행동에만 의존하는 성질을 마르코프 성질이라 부르고, 관측만 있는 경우에는 과거 관측이 여전히 정보를 주기 때문에 이 성질이 성립하지 않는다는 설명이 이어진다.
마지막으로 목표 함수와 정책이 정리된다. 궤적에 대한 확률 분포를 세우고 그 분포 아래에서 보상 합의 기댓값을 최대화하는 정책을 찾는 것이 강화학습의 목표이며, 먼 미래의 보상을 덜 중시하려면 할인 인자를 곱한다. 정책의 좋음을 재는 도구로 가치 함수와 Q 함수가 소개되고, 이후 다룰 모방학습·정책 경사·액터 크리틱·가치 기반·모델 기반 알고리즘의 지도가 제시된다.
주요 인사이트
- 상태와 관측의 구분은 추상적인 이야기가 아니라 신경망 설계로 직결된다. 상태를 쓰면 현재 입력만 넣으면 되지만, 관측만 있으면 정책에 기억을 붙여 여러 시점을 함께 넣어야 하고 그만큼 메모리 부담이 커진다.
- 보상을 상태만이 아니라 행동에도 의존하게 두는 이유로, 걷기를 배우는 로봇이 모터에 과도한 토크를 넣지 않도록 벌점을 주는 예가 제시된다.
- 로봇의 시간 표현과 대화 모델의 시간 표현은 성격이 다르다. 로봇은 초당 20번처럼 고정된 주기로 판단하지만, 대화에서는 사용자가 응답하는 시점이 다음 단계가 된다.
- 보상이 목표 달성 시에만 1이고 나머지는 0인 희소 보상에서는 학습 신호가 거의 없다. 강연자는 실제 실험에서 먼저 몇 번 시연을 보여줘 탐색을 출발시켰다고 밝힌다.
- 현실의 강화학습이 늘 매끄럽지는 않다는 점도 솔직하게 드러난다. 로봇이 퍽을 친 뒤 매번 사람이 원위치로 되돌려 놓아야 했던 실험을 두고, 사람이 로봇보다 더 많이 일하는 상황이라 데이터를 대량으로 모으기 어렵다고 말한다.
자주 묻는 질문
강화학습이 지도학습과 다른 점은 무엇인가요?
지도학습은 입력마다 정답이 주어지고 데이터가 하나의 분포에서 독립적으로 뽑혔다고 가정합니다. 반면 강화학습의 목표는 상태를 행동으로 옮기는 정책을 배우는 것이고, 정답 대신 훨씬 간접적인 피드백을 쓰며, 학습에 쓰이는 데이터가 현재 정책에 의해 만들어진다는 점이 다릅니다.
상태와 관측은 어떻게 다른가요?
상태는 결정을 내리는 데 필요한 정보를 모두 담고 있는 표현이고, 관측은 그 일부만 담을 수 있습니다. 예를 들어 대화 모델이 사용자의 가장 최근 메시지만 본다면 이는 관측이며, 이전 대화 내용을 함께 넣어야 현재 상황을 제대로 파악할 수 있습니다.
보상의 합을 왜 기댓값으로 다루나요?
같은 정책을 실행해도 매번 같은 보상이 나오지 않기 때문입니다. 강의에서는 변동의 원인을 두 가지로 정리합니다. 하나는 환경의 전이가 확률적이라는 점이고, 다른 하나는 정책 자체가 확률적으로 행동을 뽑는다는 점입니다.
할인 인자는 왜 쓰나요?
궤적 전체의 보상을 똑같이 취급하면 아주 먼 미래의 보상도 지금의 보상과 같은 비중을 갖게 됩니다. 할인 인자는 시간 단계에 따라 거듭제곱으로 곱해지며, 값이 1이면 원래 목표와 같고 값이 작아질수록 가까운 미래의 보상을 더 중시하게 됩니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗