LLM 언러닝이 매번 되살아나는 이유와 PCA로 일반 표현을 걷어내는 선택적 제거 기법
AI 세이프티 폴란드 세미나에서 필립 손데이 연구원이 발표한 언러닝 연구를 정리했다. 기존 기법이 위험 지식을 지우지 못하고 숨기기만 하는 이유, 그리고 PCA로 흔한 표현을 걷어내 특정 사실만 겨냥하는 방법과 실험 결과를 살펴본다.
핵심 내용 읽기 →AI TOPIC
LLM 해석가능성 관련 핵심 뉴스와 활용 인사이트 5편을 최신순으로 모았습니다.

AI 세이프티 폴란드 세미나에서 필립 손데이 연구원이 발표한 언러닝 연구를 정리했다. 기존 기법이 위험 지식을 지우지 못하고 숨기기만 하는 이유, 그리고 PCA로 흔한 표현을 걷어내 특정 사실만 겨냥하는 방법과 실험 결과를 살펴본다.
핵심 내용 읽기 →
LLM이 내놓는 자기 설명이 실제 추론 과정을 반영하는지 검사하는 기존 방법들은 서로 엇갈린 결과를 낸다. ACL 2024 발표 영상은 그 원인을 하나씩 짚고 CC-SHAP이라는 연속적 측정 방식을 제안한다.
핵심 내용 읽기 →
노스이스턴대 아르준 구하가 코드 LLM의 내부를 파고든 강연을 정리했다. 층마다 벡터를 더해 출력 언어를 바꾸고 타입 오예측을 최대 60% 교정한 실험, 그리고 학생 2천여 개 프롬프트에서 드러난 실패 원인을 함께 짚는다.
핵심 내용 읽기 →
해석가능성 연구자 닐 난다가 앤트로픽의 LLM 내성 논문을 처음 읽으며 실시간으로 평가한다. 개념 벡터 주입 실험의 설계, 정말 놀라운 결과와 더 단순하게 설명되는 결과, 낮은 성공률의 의미를 짚는다.
핵심 내용 읽기 →
얀닉 킬처가 앤트로픽의 '대규모 언어 모델의 생물학' 연구를 해설한다. 덧셈 회로, 내부 진단 표상, 기본 거절 회로, 탈옥이 통하는 이유를 짚고 '결국 학습이 작동한 것'이라는 반론도 함께 담았다.
핵심 내용 읽기 →