WMDP 벤치마크와 RMU 언러닝: 대규모 언어모델에서 위험 지식만 골라 지우는 방법과 한계
생물·사이버·화학 공격에 쓰일 수 있는 지식을 간접 측정하는 WMDP 벤치마크와, 일반 지식과 대화 능력은 지키면서 위험 지식만 잊게 하는 RMU 언러닝 기법을 연구자가 실험 결과와 남은 과제까지 직접 설명했다.
핵심 내용 읽기 →AI TOPIC
머신 언러닝 관련 핵심 뉴스와 활용 인사이트 4편을 최신순으로 모았습니다.

생물·사이버·화학 공격에 쓰일 수 있는 지식을 간접 측정하는 WMDP 벤치마크와, 일반 지식과 대화 능력은 지키면서 위험 지식만 잊게 하는 RMU 언러닝 기법을 연구자가 실험 결과와 남은 과제까지 직접 설명했다.
핵심 내용 읽기 →
이미지 생성 모델이 특정 개념을 만들지 못하게 막으면서 나머지 성능은 그대로 지키는 방법으로, 모델 내부 활성값을 희소 오토인코더로 분해한 뒤 해당 개념의 특징만 눌러 차단하는 SAeUron을 소개한다.
핵심 내용 읽기 →
오픈웨이트 모델은 거부 학습 같은 사후 안전장치를 파인튜닝 몇 번으로 무력화할 수 있다. 연구진은 사전학습 데이터에서 위험 지식을 미리 걸러낸 6.9B 모델을 처음부터 학습시켜 이 문제에 정면으로 접근했다.
핵심 내용 읽기 →
DMQA 연구실 오픈 세미나를 정리했다. 학습이 끝난 모델에서 특정 클래스만 재학습 없이 제거하는 클래스 레벨 언러닝의 진짜 목표와, 비슷한 클래스가 함께 망가지는 얽힘 문제, 그리고 삭제 흔적을 재는 평가 지표까지 짚는다.
핵심 내용 읽기 →