AI와 민주주의 해커톤 정리: 공개 의견 조작, 안전장치 제거, 슬리퍼 에이전트 실험
주말 해커톤에서 연구자들이 직접 AI로 민주주의를 공격해 봤다. 1달러도 안 드는 공개 의견 대량 위조, 오픈 모델의 안전장치 제거, 선거일에만 깨어나는 슬리퍼 에이전트까지 상위 프로젝트 발표 내용을 정리했다.
핵심 내용 읽기 →AI TOPIC
슬리퍼 에이전트 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

주말 해커톤에서 연구자들이 직접 AI로 민주주의를 공격해 봤다. 1달러도 안 드는 공개 의견 대량 위조, 오픈 모델의 안전장치 제거, 선거일에만 깨어나는 슬리퍼 에이전트까지 상위 프로젝트 발표 내용을 정리했다.
핵심 내용 읽기 →
일부러 백도어를 심은 모델에 안전 학습을 적용하면 그 행동이 사라질까. 앤트로픽 정렬 스트레스 테스트 팀을 이끄는 에번 후빙거는 큰 모델일수록 지워지지 않았고, 적대적 학습은 오히려 숨는 법을 가르쳤다고 말한다.
핵심 내용 읽기 →