언어모델의 숨긴 지식 캐내기: 프리필 공격과 잔차 스트림 해석을 겨루는 비밀 추출 벤치마크
AI 세이프티 폴란드 세미나에서 공개된 비밀 지식 추출 벤치마크를 정리했다. 일부러 비밀을 심은 모델 세 종을 만들어 프리필 공격과 해석가능성 기법이 얼마나 비밀을 캐내는지 겨루게 한 실험과 그 한계를 다룬다.
핵심 내용 읽기 →AI TOPIC
AI 감사 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

AI 세이프티 폴란드 세미나에서 공개된 비밀 지식 추출 벤치마크를 정리했다. 일부러 비밀을 심은 모델 세 종을 만들어 프리필 공격과 해석가능성 기법이 얼마나 비밀을 캐내는지 겨루게 한 실험과 그 한계를 다룬다.
핵심 내용 읽기 →
닐 난다가 활성화 오라클과 예측 개념 디코더 두 논문을 실시간으로 읽으며, 해석가능성에 쓰라린 교훈을 적용한 종단간 접근이 어디까지 통하고 어디서 막히는지, 비용은 얼마나 드는지 조목조목 짚어 본다.
핵심 내용 읽기 →
오픈마인드의 코엔 판 데르 페인이 벤치마크 유출로 모델 성능을 믿기 어려워진 상황을 짚으며, 모델도 평가 데이터도 공개하지 않은 채 채점하는 PySyft v2의 구조와 AI 감사의 세 기둥을 설명했다.
핵심 내용 읽기 →