Q러닝과 SARSA의 차이부터 DQN의 리플레이 버퍼·타깃 네트워크까지 강화학습 정리
AI 안전 교육과정 ARENA의 강화학습 강의를 정리했다. 정책 대신 Q 표를 직접 배우는 SARSA와 Q러닝의 차이, 절벽 예시로 본 온폴리시·오프폴리시, 그리고 상태가 너무 많을 때 신경망을 끌어들이는 DQN의 구조를 살펴본다.
핵심 내용 읽기 →AI TOPIC
Q러닝 관련 핵심 뉴스와 활용 인사이트 12편을 최신순으로 모았습니다.

AI 안전 교육과정 ARENA의 강화학습 강의를 정리했다. 정책 대신 Q 표를 직접 배우는 SARSA와 Q러닝의 차이, 절벽 예시로 본 온폴리시·오프폴리시, 그리고 상태가 너무 많을 때 신경망을 끌어들이는 DQN의 구조를 살펴본다.
핵심 내용 읽기 →
같은 절벽 앞에서 SARSA는 안전한 길을, Q러닝은 최단 경로를 택한다. 스탠퍼드 AA203 강의를 따라 두 알고리즘을 가르는 온폴리시와 오프폴리시의 차이부터, 가치 함수 근사와 DQN을 실제로 굴러가게 만든 두 장치까지 짚었다.
핵심 내용 읽기 →
ETH 취리히 로봇 학습 강의 4강을 정리했다. 전문가 시연을 흉내 내는 모방 학습의 한계에서 출발해 가치 반복과 Q러닝, DQN, 연속 행동을 다루는 DDPG까지 이어지는 강화학습의 계보를 짚는다.
핵심 내용 읽기 →
강화학습에서 가장 독창적인 아이디어로 꼽히는 시간차 학습을 몬테카를로 방법의 변형으로 차근히 설명하고, Q러닝과 SARSA·기대 SARSA가 절벽 걷기나 바람 부는 격자 같은 예제에서 왜 서로 다르게 행동하는지 정리했다.
핵심 내용 읽기 →
MIT 딥러닝 입문 강의 6.S191의 강화학습 편을 정리했다. 에이전트와 보상 같은 기본 용어부터 Q 함수와 Q러닝의 한계, 정책 학습과 연속 행동 처리, 자율주행과 바둑에 적용된 사례까지 짚는다.
핵심 내용 읽기 →
MIT 6.S191 심층 강화학습 강의 정리. 지도·비지도 학습과의 차이부터 Q 함수와 심층 Q 네트워크, 정책 경사 방식, 자율주행 데이터 기반 시뮬레이션과 알파고 사례까지 강의 순서 그대로 훑어본다.
핵심 내용 읽기 →
지도·비지도 학습과 달리 강화학습은 정답을 듣지 못하고 보상 신호로만 배운다. 출퇴근 비유로 정책, Q값, 몬테카를로 제어, 엡실론 그리디까지 강화학습의 핵심을 정리한다.
핵심 내용 읽기 →
시행착오로 배우는 강화학습의 기본 개념(에이전트·상태·행동·보상·정책)과 가치 기반 Q-러닝, 정책 기반 REINFORCE, 그리고 둘을 합친 actor-critic 방식을 예시로 정리한다.
핵심 내용 읽기 →
신발끈 묶기처럼 규칙을 일일이 지정할 수 없는 과제를 시행착오로 배우는 강화학습을, 마르코프 결정 과정·몬테카를로·시간차·Q러닝·딥 Q네트워크·정책 경사와 뇌의 도파민 연구까지 한 흐름으로 정리했다.
핵심 내용 읽기 →
스티브 브런턴 교수가 100년 역사의 강화학습을 모델 기반과 모델 프리, 경사 기반과 경사 프리, 온·오프 정책으로 나눠 전체 지형도를 그린다. 벨만 방정식부터 딥 Q러닝까지의 큰 그림.
핵심 내용 읽기 →
강화학습은 상황을 행동에 매핑해 보상을 최대화하는 학습이다. 가치 기반 방법과 정책 기반 방법의 차이, 상태 가치 함수 V와 상태 행동 가치 함수 Q, 그리고 가치 함수를 재귀적으로 계산하는 벨만 방정식의 직관을 그리드 예제로 정리했다.
핵심 내용 읽기 →
환경 모델 없이 시행착오로 배우는 강화학습에서 몬테카를로 학습과 시간차 학습의 차이부터 Q-러닝과 SARSA, 오프폴리시와 온폴리시의 구분, 그리고 입실론-그리디 탐험 전략까지 핵심 원리를 쉽게 정리했습니다.
핵심 내용 읽기 →