강화학습 기초 강의 정리: 정책 경사부터 PPO까지, 언어 모델이 지도학습을 넘어서는 이유
CMU 고급 자연어처리 강의가 다룬 강화학습 기초를 정리했다. 지도 미세조정의 세 가지 한계, 마르코프 결정 과정과 정책 경사, 할인과 베이스라인, PPO의 클리핑까지 언어 모델 학습의 뼈대를 짚는다.
핵심 내용 읽기 →AI TOPIC
CMU 강의 관련 핵심 뉴스와 활용 인사이트 5편을 최신순으로 모았습니다.

CMU 고급 자연어처리 강의가 다룬 강화학습 기초를 정리했다. 지도 미세조정의 세 가지 한계, 마르코프 결정 과정과 정책 경사, 할인과 베이스라인, PPO의 클리핑까지 언어 모델 학습의 뼈대를 짚는다.
핵심 내용 읽기 →
컨텍스트가 길어질수록 LLM이 느려지는 진짜 이유는 연산량이 아니라 KV 캐시 전송이다. CMU 초청 강의가 정리한 압축의 한계와 추측 디코딩·MagicPIG 대안, 긴 문맥 추론 능력을 재는 새 평가 방식을 함께 짚는다.
핵심 내용 읽기 →
CMU 고급 자연어처리 강의를 바탕으로 빔서치의 작동 원리와 길이 정규화 방법, 다양성 빔서치·확률적 빔서치 같은 변형, 그리고 빔 폭을 키울수록 오히려 품질이 떨어지는 '빔서치의 저주'라는 역설까지 정리했습니다.
핵심 내용 읽기 →
CMU 그레이엄 뉴빅 교수의 대규모 언어모델 추론 강의를 정리했다. 생각의 사슬이 작동하는 이유와 학습 데이터에서 이 능력이 나온 배경, 수학·논리 밖에서 효과가 약해지는 지점, 여러 답을 뽑아 다수결하는 자기 일관성의 비용, 그리고 설명의 충실성 문제까지 짚는다.
핵심 내용 읽기 →
카네기멜런대 LLM 추론 강의 첫 시간이 언어 모델의 실행 비용을 뜯어봤다. 긴 문맥에서 어텐션이 왜 급격히 비싸지는지, 학습과 추론이 어떻게 다른지, 탐색 오류와 모델 오류를 왜 구분해야 하는지 정리했다.
핵심 내용 읽기 →