LLM 강화학습 RLHF 정리: KL 제약의 기원부터 개인화 보상 모델과 다원적 정렬 연구까지
딥시크 R1 이후 다시 주목받은 LLM 강화학습의 계보를 정리한다. 2016년 음악 생성 연구에서 출발한 KL 제약, 단일 보상 함수를 가정하는 RLHF의 구조적 한계, 그리고 사용자별 선호를 반영하는 개인화 보상 모델 연구까지 짚는다.
핵심 내용 읽기 →AI TOPIC
개인화 관련 핵심 뉴스와 활용 인사이트 5편을 최신순으로 모았습니다.

딥시크 R1 이후 다시 주목받은 LLM 강화학습의 계보를 정리한다. 2016년 음악 생성 연구에서 출발한 KL 제약, 단일 보상 함수를 가정하는 RLHF의 구조적 한계, 그리고 사용자별 선호를 반영하는 개인화 보상 모델 연구까지 짚는다.
핵심 내용 읽기 →
ChatGPT가 이름과 취미까지 기억하는 이유를 대화창 안의 단기기억과 대화창을 넘는 메모리 기능으로 나눠 설명한다. 2,000토큰에서 100만 토큰으로 늘어난 수용량과 2025년 4월 통합 메모리까지의 흐름을 짚는다.
핵심 내용 읽기 →
하나의 인터페이스에 모든 기능을 욱여넣어 늘 뻔한 답을 내놓는 'AI 스포크 문제'와, 사용자의 화면·맥락을 관찰해 그 순간의 목표를 즉석에서 추론하는 스탠퍼드의 적시(Just-in-Time) 목표 연구, 나아가 소셜미디어 피드 개선까지 확장한 사례를 정리했다.
핵심 내용 읽기 →
소프트웨어를 만드는 비용이 0에 수렴하면서 '모두에게 하나의 버전'이라는 전제가 무너진다. 사용자마다 다른 버전을 안전하게 운영하는 스템·분기 구조를 다룬 강연 정리.
핵심 내용 읽기 →
인메모리 세션은 앱이 재시작되면 사라진다. 데이터베이스 세션 서비스와 사용자 프로필 저장소로 AI 에이전트가 대화와 사용자 취향을 오래 기억하게 만드는 방법을 정리했다.
핵심 내용 읽기 →