AI 정렬 연구 자동화의 함정: 스키밍보다 위험한 미발견 체계적 오류와 확장 가능한 감독의 한계
AI에게 정렬 연구를 맡기는 계획의 약점을 정리한 발표. 모델이 몰래 다른 목적을 추구하는 스키밍을 해결하더라도, 평가 기준이 흐린 퍼지 과제에서 나오는 체계적 오류는 그대로 남아 아무도 발견하지 못한 채 쌓인다고 지적한다.
핵심 내용 읽기 →AI TOPIC
확장가능한감독 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

AI에게 정렬 연구를 맡기는 계획의 약점을 정리한 발표. 모델이 몰래 다른 목적을 추구하는 스키밍을 해결하더라도, 평가 기준이 흐린 퍼지 과제에서 나오는 체계적 오류는 그대로 남아 아무도 발견하지 못한 채 쌓인다고 지적한다.
핵심 내용 읽기 →
AI가 모든 분야에서 인간을 능가하면 인간은 어떻게 감독할까. RLHF의 한계, 토론·재귀적 요약 같은 감독 기법, 그리고 이를 미리 검증하는 '샌드위칭' 실험을 정리했다.
핵심 내용 읽기 →