검증 불가능한 과제의 강화학습: 2,200만 파라미터 보상 모델로 소형 언어모델 훈련하기
수학처럼 채점할 수 없는 요약·질의응답 과제에서 강화학습을 돌리려면 보상 함수부터 직접 만들어야 한다. 작은 답변 동등성 모델을 훈련하며 드러난 세 가지 편향과 두 차례의 리워드 해킹, 그리고 그 해결 과정을 정리했다.
핵심 내용 읽기 →AI TOPIC
보상 모델 관련 핵심 뉴스와 활용 인사이트 9편을 최신순으로 모았습니다.

수학처럼 채점할 수 없는 요약·질의응답 과제에서 강화학습을 돌리려면 보상 함수부터 직접 만들어야 한다. 작은 답변 동등성 모델을 훈련하며 드러난 세 가지 편향과 두 차례의 리워드 해킹, 그리고 그 해결 과정을 정리했다.
핵심 내용 읽기 →
대학 연구 세미나에서 발표된 다목적·다집단 RLHF 연구를 정리했다. 보상 모델을 유용성과 무해성으로 나누는 이유, 가중치를 역으로 추정하는 방법, 선형 합산의 한계와 집단 간 선호 충돌 해법을 짚는다.
핵심 내용 읽기 →
ChatGPT를 길들인 RLHF는 보상 모델 학습과 강화학습 루프가 필요했다. DPO는 이 두 단계를 지우고 선호 쌍 분류 손실 하나로 같은 정렬을 얻는데, 그 수식이 나오기까지의 유도 과정을 단계별로 짚어본다.
핵심 내용 읽기 →
구글 딥마인드와 UC 버클리가 쓴 테스트 타임 컴퓨팅 논문을 야닉 킬처가 뜯어봤다. 추론 단계에 연산을 더 쓰는 방법들을 비교하고, 사전학습 확대와 어느 쪽이 유리한지, 저자들의 일반화 주장이 어디까지 믿을 만한지 짚는다.
핵심 내용 읽기 →
CMU 고급 NLP 강의가 다룬 Best-of-N과 보상 모델의 원리를 정리했습니다. 기각 표집과의 관계, 생성형 보상 모델의 비일관성, 길이 편향 같은 실제 함정, 그리고 선호 데이터를 지금 누가 만드는지까지 다룹니다.
핵심 내용 읽기 →
스탠퍼드 CS329A 2강은 모델을 다시 학습시키지 않고 추론 시점에 컴퓨팅을 더 써서 성능을 끌어올리는 방법을 다룬다. 반복 샘플링의 멱법칙, 검증자의 한계와 생성·검증 격차, 아콘 프레임워크의 실험 결과까지 정리했다.
핵심 내용 읽기 →
오픈AI가 o1의 학습법을 거의 공개하지 않은 가운데, 기술 문서에 남은 단서와 이전 보상 모델 논문을 겹쳐 사고 사슬 토큰과 결과 감독·과정 감독 보상 모델을 활용한 강화학습 구조를 추론해 정리하고, 강점과 남은 한계까지 함께 짚었다.
핵심 내용 읽기 →
ChatGPT를 만든 정렬 기법 RLHF를 수식으로 풀어본다. 언어 모델을 정책으로 보는 관점부터 선호 데이터로 학습하는 보상 모델, 정책 경사, 어드밴티지, 그리고 PPO 손실까지 단계별로 짚는다.
핵심 내용 읽기 →
세바스티안 라시카가 4분 만에 정리한 RLHF. 사람이 쓴 응답으로 지도 파인튜닝을 하고, 순위 데이터로 보상 모델을 학습한 뒤 PPO로 모델을 정렬하는 3단계를 설명한다.
핵심 내용 읽기 →