검증 불가능한 과제의 강화학습: 2,200만 파라미터 보상 모델로 소형 언어모델 훈련하기
수학처럼 채점할 수 없는 요약·질의응답 과제에서 강화학습을 돌리려면 보상 함수부터 직접 만들어야 한다. 작은 답변 동등성 모델을 훈련하며 드러난 세 가지 편향과 두 차례의 리워드 해킹, 그리고 그 해결 과정을 정리했다.
핵심 내용 읽기 →AI TOPIC
리워드 해킹 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

수학처럼 채점할 수 없는 요약·질의응답 과제에서 강화학습을 돌리려면 보상 함수부터 직접 만들어야 한다. 작은 답변 동등성 모델을 훈련하며 드러난 세 가지 편향과 두 차례의 리워드 해킹, 그리고 그 해결 과정을 정리했다.
핵심 내용 읽기 →
AI 타임라인 논쟁의 중심에 선 시간지평 그래프를 만든 METR 연구자들이 머신러닝 스트리트 토크에 나와 측정 방식과 오차 범위, 흔한 오독, 이 지표로 말할 수 있는 것과 없는 것을 직접 설명했다.
핵심 내용 읽기 →
한 유튜브 크리에이터가 전한 이번 주 AI 화제들. 클로드로 만든 플레이스테이션1 개발환경, 'AI 직원'이라 부를 때 벌어지는 일, 규칙의 허점을 파고드는 리워드 해킹 연구를 짚었다.
핵심 내용 읽기 →