문화적 AI 학회 정리: LLM 레드팀·정렬·측정을 인문학이 읽는 법 (NYU 디지털이론랩)
NYU 디지털이론랩이 연 '문화적 AI' 학회 현장 기록. 버전 관리와 AI 슬롭, 논리와 노동 논쟁, 프로이트식 검열로 읽은 탈옥, 측정이라는 통치, 레드팀이 드러낸 생성 언어의 기하학까지 정리했습니다.
핵심 내용 읽기 →AI TOPIC
LLM 정렬 관련 핵심 뉴스와 활용 인사이트 6편을 최신순으로 모았습니다.

NYU 디지털이론랩이 연 '문화적 AI' 학회 현장 기록. 버전 관리와 AI 슬롭, 논리와 노동 논쟁, 프로이트식 검열로 읽은 탈옥, 측정이라는 통치, 레드팀이 드러낸 생성 언어의 기하학까지 정리했습니다.
핵심 내용 읽기 →
CMU 고급 NLP 강의가 다룬 Best-of-N과 보상 모델의 원리를 정리했습니다. 기각 표집과의 관계, 생성형 보상 모델의 비일관성, 길이 편향 같은 실제 함정, 그리고 선호 데이터를 지금 누가 만드는지까지 다룹니다.
핵심 내용 읽기 →
보상 모델을 따로 훈련하지 않고도 언어모델을 사람의 선호에 맞추는 DPO. 브래들리-테리 선호 모델에서 손실 함수가 유도되는 과정과 계산 불가능한 항이 사라지는 원리, 실제 로그 확률 계산 방법까지 단계별로 풀어 정리했습니다.
핵심 내용 읽기 →
사람의 선호도 라벨이 비싸고 느리다는 RLHF의 약점을 AI 피드백으로 대체한 RLAIF 논문을 정리했다. 요약과 대화 생성 과제에서 사람 수준의 선호도가 나온 이유, 보상 모델을 없앤 d-RLAIF, 위치 편향 같은 한계를 함께 살펴본다.
핵심 내용 읽기 →
ChatGPT가 사람처럼 답하게 만든 핵심 기법 RLHF(인간 피드백 기반 강화학습)의 단계별 원리와, 사람 대신 AI가 피드백을 주는 앤트로픽의 대안 RLAIF까지 자막에 담긴 내용을 정리했습니다.
핵심 내용 읽기 →
RLHF는 강력하지만 보상 모델 학습과 강화학습이 비싸고 불안정하다. DPO는 보상 모델을 건너뛰고 간단한 교차 엔트로피 손실로 선호 데이터에서 바로 미세조정하는 방법으로, RLHF와 수학적으로 동등하다.
핵심 내용 읽기 →