로봇 강화학습 탐색 전략 정리: 시뮬레이터와 사람 시연 데이터를 제대로 쓰는 방법과 실제 로봇 실험 결과
UC 버클리 연구자가 TTIC 강연에서 시뮬레이터의 최적 정책을 실물 로봇으로 그대로 옮기는 기존 방식의 한계를 짚고, 대신 탐색 정책을 옮기거나 사람 시연을 사후분포로 학습하는 접근과 실제 로봇에서 확인한 개선 폭을 설명했다.
핵심 내용 읽기 →AI TOPIC
확산 정책 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

UC 버클리 연구자가 TTIC 강연에서 시뮬레이터의 최적 정책을 실물 로봇으로 그대로 옮기는 기존 방식의 한계를 짚고, 대신 탐색 정책을 옮기거나 사람 시연을 사후분포로 학습하는 접근과 실제 로봇에서 확인한 개선 폭을 설명했다.
핵심 내용 읽기 →
언어 모델에서는 선형으로 쌓이는 모방학습 오차가 연속 제어에서는 지수로 폭발한다. CMU 로보틱스 세미나는 액션 청킹과 생성형 제어 정책이 왜 이 문제를 실제로 완화하는지 이론과 절제 실험으로 함께 짚는다.
핵심 내용 읽기 →
이미지 생성에 쓰던 확산 모델로 로봇 행동을 만드는 확산 정책. 왜 행동의 평균을 내는 정책이 실패하는지, 왜 행동을 한 걸음이 아니라 묶음으로 예측해야 하는지, 논문 저자가 개발 뒷이야기와 함께 직접 설명한다.
핵심 내용 읽기 →