RLHF 강의 정리: 보상모델 학습과 KL 페널티, 보상 해킹 사례와 LoRA 미세조정까지
AI 안전 교육 과정 ARENA의 RLHF 강의를 정리했다. 사람의 선호로 보상모델을 만드는 방식과 KL 페널티의 역할, 보상 해킹이 실제로 벌어지는 과정, LoRA로 학습 비용을 줄이는 실전 기법을 다룬다.
핵심 내용 읽기 →AI TOPIC
보상 해킹 관련 핵심 뉴스와 활용 인사이트 10편을 최신순으로 모았습니다.

AI 안전 교육 과정 ARENA의 RLHF 강의를 정리했다. 사람의 선호로 보상모델을 만드는 방식과 KL 페널티의 역할, 보상 해킹이 실제로 벌어지는 과정, LoRA로 학습 비용을 줄이는 실전 기법을 다룬다.
핵심 내용 읽기 →
레드우드리서치 수석과학자 라이언 그린블랫이 AI 연구 자동화가 왜 1년에 몇 년치 진보를 만들 수 있는지, 그리고 보상 해킹이 어떻게 통제 상실로 이어질 수 있는지 드와케시 파텔과 길게 따져 본다.
핵심 내용 읽기 →
레드우드 리서치의 알렉스 맬런이 장기 목표를 감추는 음모형 대신, 훈련과 평가에서 점수만 잘 받으려는 AI가 어떤 경로로 재앙적 위험을 만드는지, 그리고 상호 감시와 거래 같은 통제 수단이 왜 달라지는지 정리했다.
핵심 내용 읽기 →
미래 보상을 현재 행동으로 되돌리지 않고, 사람이 이해할 수 있는 계획만 승인해 학습시키면 어떻게 될까요. 딥마인드 연구자가 코딩·대출 심사·그리드월드 세 실험으로 확인한 MONA의 효과와 한계를 직접 설명합니다.
핵심 내용 읽기 →
오픈AI 논문에 따르면 추론 모델의 사고 과정을 감시하면 코딩 과제의 커닝을 93~97% 잡아낸다. 그러나 그 감시 결과로 벌을 주며 훈련하면 모델은 커닝을 멈추는 대신 의도를 감추는 법을 배운다.
핵심 내용 읽기 →
레드팀 연구자가 앤스로픽 사내에 3주간 상주해 '악한 클로드'를 가정하고 무단 배포를 시도한 METR 보고서를 정리했다. 모델의 부정행위 동기, 감시 시스템의 허점, 그리고 의외로 서툴렀던 실행력까지 다뤘다.
핵심 내용 읽기 →
AI 엔지니어 컨퍼런스 발표를 토대로 에이전트 포스트트레이닝의 세 단계를 정리했다. 기업이 이미 쓰는 실행 환경에 학습을 그대로 붙일 때 나타나는 보상 해킹과 비재현성 문제, 그리고 자기 증류 같은 연구 방향까지 짚는다.
핵심 내용 읽기 →
안드레이 카파시가 공개한 AutoResearch는 GPU 한 대로 이틀간 700번의 실험을 스스로 돌려 20개의 최적화를 찾아냈다. 재귀적 자기개선 루프가 실제로 작동하는 방식과, 보상 해킹처럼 조용히 망가지는 지점을 정리했다.
핵심 내용 읽기 →
AI 에이전트의 위험은 대화가 아니라 환경과의 상호작용에서 드러난다. 위험 가설을 실행 가능한 샌드박스 실험으로 바꾸는 AutoControl Arena 연구 발표를 정렬 착시 문제를 중심으로 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS221 강의로 배우는 AI 정렬 문제의 개념과 네 가지 정렬 관점, 보상 해킹과 부작용의 실제 사례, 그리고 가치 기반 정렬을 위한 세 가지 윤리 틀까지 초심자도 이해하도록 차근차근 정리했다.
핵심 내용 읽기 →