WMDP 벤치마크와 RMU 언러닝: 대규모 언어모델에서 위험 지식만 골라 지우는 방법과 한계
생물·사이버·화학 공격에 쓰일 수 있는 지식을 간접 측정하는 WMDP 벤치마크와, 일반 지식과 대화 능력은 지키면서 위험 지식만 잊게 하는 RMU 언러닝 기법을 연구자가 실험 결과와 남은 과제까지 직접 설명했다.
핵심 내용 읽기 →AI TOPIC
AI 위험 관련 핵심 뉴스와 활용 인사이트 7편을 최신순으로 모았습니다.

생물·사이버·화학 공격에 쓰일 수 있는 지식을 간접 측정하는 WMDP 벤치마크와, 일반 지식과 대화 능력은 지키면서 위험 지식만 잊게 하는 RMU 언러닝 기법을 연구자가 실험 결과와 남은 과제까지 직접 설명했다.
핵심 내용 읽기 →
튜링상 수상자 요슈아 벤지오가 스탠퍼드 디지털경제연구소 에세이에서 제시한 혼돈·권력 집중·통제 상실이라는 세 가지 AI 위험과, AI를 기후변화나 핵처럼 글로벌 공공재로 관리하자는 국제 협력 구상을 정리했다.
핵심 내용 읽기 →
MIT 연구팀이 국제 AI 전문가 270여 명을 상대로 3라운드 델파이 조사를 진행했다. 향후 5년간 가장 심각한 위험은 무엇인지, 어떤 산업이 가장 취약한지, 그리고 책임과 피해가 서로 어긋나 있는 구조를 정리했다.
핵심 내용 읽기 →
미국인 1천 명 대상 메시지 실험 결과, 실존적 위험 메시지가 가장 반응이 낮았다. IASEAI 공개 세션에서 나온 AI 위험 커뮤니케이션 연구를 정리했다.
핵심 내용 읽기 →
AI를 불에 비유하며 일자리 감소, 에너지 소비, 감시, 무기화, 저작권 침해, 허위정보, 통제 불능까지 지금 지켜봐야 할 일곱 가지 위험을 짧게 정리했다.
핵심 내용 읽기 →
AI 연구자 카렌 하오의 인터뷰를 다룬 영상으로, 소수 빅테크가 데이터·노동·지식을 독점하며 AI를 통제하는 '제국' 같은 구조와 그 위험을 짚는다.
핵심 내용 읽기 →
쿠르츠게작트가 지능의 진화부터 AGI, 초지능, 지능 폭발 시나리오까지 정리했다. 왜 AI가 인류의 마지막 발명품이 될 수 있는지, 그 가능성과 위험을 짚는다.
핵심 내용 읽기 →