LLM 안전성 평가 디코딩트러스트 정리: 독성·프라이버시·적대적 공격에서 드러난 취약점
시카고대 보 리 교수가 정리한 언어모델 신뢰성 평가 결과. 지시를 잘 따르는 모델일수록 공격에 더 쉽게 무너지는 역설과 사전학습 데이터 유출 실험, 규제에 기반한 공통 안전 분류 체계 제안까지 살펴본다.
핵심 내용 읽기 →AI TOPIC
적대적 공격 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

시카고대 보 리 교수가 정리한 언어모델 신뢰성 평가 결과. 지시를 잘 따르는 모델일수록 공격에 더 쉽게 무너지는 역설과 사전학습 데이터 유출 실험, 규제에 기반한 공통 안전 분류 체계 제안까지 살펴본다.
핵심 내용 읽기 →
펜실베이니아대 AI 세미나에서 르네 비달 교수가 발표한 특징 학습 이론을 정리했다. 뉴런이 먼저 정렬되고 나중에 수렴하는 두 단계, ReLU의 지수를 바꿔 적대적 공격 취약성을 없애는 방법을 다룬다.
핵심 내용 읽기 →
브라운대 토마 세르 교수가 MIT 강연에서 이미지 분류 정확도가 인간을 넘어선 딥러닝 모델들이 오히려 사람과 전혀 다른 단서를 본다는 측정 결과와, 이 어긋남을 되돌리는 학습 기법 및 새로운 데이터 설계 방향을 함께 설명했다.
핵심 내용 읽기 →