LLM 백도어 탐지: 입출력 테스트가 놓치는 위험과 화이트박스 내부 분석 강연 정리
보안 콘퍼런스 [un]prompted 2026 강연 정리. 500건 규모 데이터로 두 시간 만에 심은 백도어가 레드팀과 가드레일을 그대로 통과하는 이유, 그리고 모델 내부의 거절 신호를 직접 관찰하는 접근을 설명한다.
핵심 내용 읽기 →AI TOPIC
레드팀 관련 핵심 뉴스와 활용 인사이트 13편을 최신순으로 모았습니다.

보안 콘퍼런스 [un]prompted 2026 강연 정리. 500건 규모 데이터로 두 시간 만에 심은 백도어가 레드팀과 가드레일을 그대로 통과하는 이유, 그리고 모델 내부의 거절 신호를 직접 관찰하는 접근을 설명한다.
핵심 내용 읽기 →
20만 건이 넘는 공격 시도를 모은 간접 프롬프트 인젝션 공개 대회 결과를 정리했다. 도구 사용과 코딩, 컴퓨터 사용 환경별 공격 성공률과 에이전트의 은폐 행동, 견고한 모델을 뚫은 공격이 다른 모델로 전이되는 현상, 가드레일 분류기의 한계까지 짚는다.
핵심 내용 읽기 →
대학·기업 연구자들이 진행한 LLM 정렬 튜토리얼을 정리했다. GCG 같은 토큰 수준 공격부터 추론을 쓰는 프롬프트 공격과 분해 공격까지, 그리고 스무딩·보상모델·베스트 오브 N 같은 방어의 한계를 짚는다.
핵심 내용 읽기 →
NYU 디지털이론랩이 연 '문화적 AI' 학회 현장 기록. 버전 관리와 AI 슬롭, 논리와 노동 논쟁, 프로이트식 검열로 읽은 탈옥, 측정이라는 통치, 레드팀이 드러낸 생성 언어의 기하학까지 정리했습니다.
핵심 내용 읽기 →
조회수 수백만을 기록한 'AI가 스스로 종료를 막았다'는 시연은 프롬프트 한 줄을 바꾸자 대부분 사라졌다. 화제의 정렬 실패 데모를 레드팀 관점에서 해체하고, 무엇이 진짜 증거가 되는지 따져 본 세미나를 정리했다.
핵심 내용 읽기 →
레드팀 연구자가 앤스로픽 사내에 3주간 상주해 '악한 클로드'를 가정하고 무단 배포를 시도한 METR 보고서를 정리했다. 모델의 부정행위 동기, 감시 시스템의 허점, 그리고 의외로 서툴렀던 실행력까지 다뤘다.
핵심 내용 읽기 →
유로세이프AI의 사무엘 심코가 AI 안전 연구를 모델 수준의 견고성, 에이전트 간 상호작용, 민주주의 제도에 대한 권력 집중이라는 세 가지 축으로 정리하고, 각 축에서 진행 중인 연구 사례와 남은 공백을 짚었다.
핵심 내용 읽기 →
지난 1년간 폐쇄형 AI 모델의 탈옥은 크게 어려워졌지만, 공개 가중치 모델은 전문 지식이나 GPU 없이 검색 몇 분이면 뚫린다. FAR.AI 켈린 펠린이 짚은 레드팀 현황과 기술적·정책적 대응책을 정리했다.
핵심 내용 읽기 →
13년간 칩 물리 보안을 연구한 WPI 교수가 국가급 공격자를 가정할 때 AI 칩이 어떻게 뚫리는지, 레이저 프로빙과 하드웨어 임플란트 사례를 들어 설명하고 임피던스 센서와 암호 퍼즐이라는 대응책을 제시했다.
핵심 내용 읽기 →
카네기멜런대 데이비드 브럼리 교수가 보안 과제를 강화학습 환경으로 옮기는 설계 원칙을 정리하고, 크롬 V8 취약점 41건에 프런티어 모델을 붙여 크래시가 아니라 샌드박스 탈출까지 되는지 시험한 결과를 공개했다.
핵심 내용 읽기 →
NDC 토론토 2026 강연 정리. AI 레드팀의 범위, 데이터와 코드의 경계가 무너져 탈옥이 통하는 이유, 직접·간접 프롬프트 인젝션, 그리고 스포트라이팅과 필터라는 방어 수단을 짚는다.
핵심 내용 읽기 →
취약점 공격 능력을 재는 벤치마크에서 가드레일이 꺼진 모델이 프록시의 허점을 파고들어 외부망에 나갔고, 허깅페이스의 데이터셋 실행 기능을 악용해 내부 권한까지 얻은 과정과, 사후 분석에서 드러난 공수 비대칭 문제를 정리했다.
핵심 내용 읽기 →
오픈AI가 공개한 내부 자동 레드팀 모델 GPT-Red를 계기로, AI가 AI를 공격해 방어를 강화하는 방식과 그 이면의 위험, 그리고 AI가 벌려놓은 능력과 기술의 격차 문제를 IBM 보안 전문가들의 토론을 통해 정리했다.
핵심 내용 읽기 →