AI TOPIC

강화학습 최신 뉴스와 핵심 해설

강화학습 관련 핵심 뉴스와 활용 인사이트 242편을 최신순으로 모았습니다.

역전파 없이 LLM을 다듬는다: 진화 전략이 강화학습의 대안이 될 수 있을까 영상 썸네일
alphaXiv

진화 전략으로 LLM 미세조정하기: 역전파 없이 강화학습을 대체하는 그래디언트 프리 학습법

코그니전트 AI 랩 연구진이 수십억 파라미터 언어 모델을 역전파 없이 미세조정한 실험을 공개했다. 가중치에 잡음을 더한 모델 30개만 비교해도 강화학습에 맞먹는 성능이 나왔고, 시드와 하이퍼파라미터를 바꿔도 결과 편차가 훨씬 작았다는 점이 핵심이다.

핵심 내용 읽기 →
휴머노이드는 왜 배우기 어려운가, 버클리 세미나가 짚은 네 가지 해법 영상 썸네일
EMBER Center @ UC Berkeley

휴머노이드 로봇 학습의 병목과 해법: 사람 동작 데이터, 몸을 반영한 신경망, 15분 만의 보행 학습까지

손을 떼면 학습이 잘된다는 실험 결과에서 출발해, 휴머노이드 로봇이 복잡한 동작을 익히기 어려운 이유와 연구자들이 찾은 네 가지 돌파구를 UC 버클리 세미나 발표를 바탕으로 정리했다. 의자를 밟고 올라선 뒤 뛰어내려 낙법으로 착지하는 동작까지 다룬다.

핵심 내용 읽기 →
걷고 기고 오르고 구른다 — 네 가지 이동 방식을 오가는 이족 로봇 모비우스 영상 썸네일
Mitsubishi Electric Research Laboratories (MERL)

다중 모드 이족 로봇 모비우스 정리: 걷기 기기 등반 구르기 전환과 힘 제어 방식

걷기와 기어가기, 등반과 구르기를 상황에 따라 갈아타는 이족 로봇 모비우스를 정리했다. 경로와 지형, 이동 모드를 한 번에 푸는 상위 계획기와 자동 튜닝 힘 제어, 강화학습 보행 정책, 넘어지면 사족으로 전환하는 복구 방식까지 살펴본다.

핵심 내용 읽기 →
모방학습과 강화학습은 어떻게 갈라지는가 — 스탠퍼드 AA203 14강 정리 영상 썸네일
Stanford Online

모방학습 강화학습 차이 정리 — 스탠퍼드 AA203 14강, 행동 복제부터 역강화학습과 가치 함수까지

스탠퍼드 AA203 14강은 전문가 시연을 따라 하는 모방학습과 시행착오로 배우는 강화학습을 나란히 놓고 비교한다. 행동 복제의 분포 이동 문제, 보상 함수를 거꾸로 복원하는 역강화학습, 가치 함수와 신용 할당까지 자율 시스템 학습의 뼈대를 짚는다.

핵심 내용 읽기 →
오픈AI o1은 어떻게 '생각'하게 됐을까, 공개 단서로 되짚은 추론 학습법 영상 썸네일
AI Coffee Break with Letitia

오픈AI o1 추론 원리 분석: 사고 사슬 토큰과 결과·과정 감독 보상 모델로 되짚은 강화학습 방식

오픈AI가 o1의 학습법을 거의 공개하지 않은 가운데, 기술 문서에 남은 단서와 이전 보상 모델 논문을 겹쳐 사고 사슬 토큰과 결과 감독·과정 감독 보상 모델을 활용한 강화학습 구조를 추론해 정리하고, 강점과 남은 한계까지 함께 짚었다.

핵심 내용 읽기 →