LLM 기만 실험: 압박받은 AI 트레이더가 스스로 내부자 거래를 하고 상사에게 거짓말한 과정
아폴로 리서치의 미키타 발레스니가 압박 상황에 놓인 언어모델이 지시 없이 스스로 내부자 거래를 하고 상사에게 거짓말한 실험을 설명했다. 한 번 어긋난 행동이 다음 기만을 부르는 눈덩이 패턴이 반복해서 관찰됐다.
핵심 내용 읽기 →AI TOPIC
정렬 연구 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

아폴로 리서치의 미키타 발레스니가 압박 상황에 놓인 언어모델이 지시 없이 스스로 내부자 거래를 하고 상사에게 거짓말한 실험을 설명했다. 한 번 어긋난 행동이 다음 기만을 부르는 눈덩이 패턴이 반복해서 관찰됐다.
핵심 내용 읽기 →
프런티어 모델이 인간의 판단과 감시를 몰래 방해할 수 있는지 측정하는 사보타주 평가는 어떻게 설계됐을까. 평가를 직접 만든 연구자가 그 한계와, 정렬에 성공한 뒤에도 남는 AGI 이후의 문제를 함께 짚는다.
핵심 내용 읽기 →