AI VIDEO BRIEFING
AI 탈옥 레드팀 현황 보고: 폐쇄형 모델은 방어가 두터워졌지만 공개 가중치 모델은 여전히 취약하다
지난 1년간 폐쇄형 AI 모델의 탈옥은 크게 어려워졌지만, 공개 가중치 모델은 전문 지식이나 GPU 없이 검색 몇 분이면 뚫린다. FAR.AI 켈린 펠린이 짚은 레드팀 현황과 기술적·정책적 대응책을 정리했다.

핵심 메시지
쉽게 이해하기
AI 안전 연구 조직 FAR.AI의 켈린 펠린이 레드팀(취약점 공격 시험)과 탈옥의 현재 상태를 짧게 정리한 발표다. 상대적으로 좋은 소식부터 꺼내는데, 폐쇄형 가중치 모델을 탈옥하기가 지난 1년 사이 훨씬 어려워졌다는 것이다. 개발사들이 생물·사이버처럼 위험이 큰 영역에 방어 장치를 많이 배치한 결과다.
펠린은 이 변화의 성격을 짚는다. 완전히 해결된 것은 아니지만, 문제가 '과학적 돌파구가 필요한 단계'에서 '좋은 공학과 폭넓은 도입이 필요한 단계'로 옮겨왔다는 것이다. 즉 무엇을 해야 할지는 어느 정도 알게 됐고, 남은 것은 그것을 제대로 만들어 널리 적용하는 일이라는 진단이다.
나쁜 소식은 공개 가중치 모델 쪽이다. 여전히 탈옥이 사실상 사소한 일이라고 그는 말한다. 전문가가 아니어도 15분 정도 검색해서 안전 정렬을 제거한 변형 모델을 내려받으면 꽤 순순히 응답하는 모델을 손에 넣을 수 있다는 것이다. 흔히 예상하는 것과 달리 GPU나 미세조정 기술 같은 자원이 꼭 필요하지도 않았다.
공격 방식도 단순하다. 사용자 프롬프트만으로 되는 공개 탈옥이 있고, 시스템 프롬프트에 접근할 수 있으면 또 다른 공개 기법을 쓸 수 있으며, 프리필(모델 응답 앞부분을 미리 채워 넣는 방식)에 접근할 수 있으면 프리필 공격이 가능하다. 딥시크의 경우 이전 모델용으로 공개된 탈옥 프롬프트가 패치되지 않은 채 그대로 통한 사례도 언급된다. 공개 가중치 모델의 고유 위험을 미세조정·변조 같은 것으로만 생각하기 쉽지만, 실제로는 입력 공간 공격에도 그대로 노출돼 있다는 뜻이다.
그렇다면 방법이 없느냐 하면 그렇지 않다는 것이 발표의 결론이다. 외부 안전장치 없이 모델 자체만으로도 입력 기반 탈옥에 훨씬 강한 폐쇄형 모델 사례가 있는 만큼, 견고한 공개 가중치 모델을 만드는 일 자체는 충분히 가능하다는 것이다. 사전학습 단계에서 위험한 능력을 걸러내는 필터링 연구가 진행 중이고, 특정 능력을 하나의 전문가 모듈에 몰아넣었다가 그 모듈을 떼어내는 그래디언트 라우팅 같은 방향도 거론된다.
주요 인사이트
- 공개 가중치 모델의 위험을 논할 때 흔히 '누구나 미세조정해서 안전장치를 떼어낼 수 있다'는 점에 초점이 맞춰지지만, 실제 진입 장벽은 그보다 훨씬 낮다. 검색과 복사·붙여넣기 수준의 입력 공격만으로도 충분하다는 것이 이 발표의 핵심 경고다.
- 탈옥해도 성능이 함께 무너진다면 공격의 실익이 적다. 그런데 강한 모델일수록 이 '탈옥세'가 사라진다는 관측은, 모델이 좋아질수록 탈옥의 위험성도 함께 커진다는 뜻이 된다.
- 폐쇄형 모델의 방어가 자리를 잡아간다는 사실은 역설적으로 공개 가중치 모델에 희망이 된다. 견고함이 폐쇄성 자체에서 나오는 게 아니라 모델을 만드는 방식에서 나온다는 증거이기 때문이다.
- 단 하나로 모든 것을 해결하는 만능 대책은 어떤 AI 모델에도 없다는 점을 발표자는 분명히 한다. 대신 여러 기술적·제도적 수단을 겹겹이 쌓아 위험을 실질적으로 줄이자는 접근을 제안한다.
자주 묻는 질문
공개 가중치 모델을 탈옥하려면 GPU나 미세조정 기술이 필요한가요?
발표에 따르면 그렇지 않습니다. 많은 사람이 자원과 전문성이 필요하리라 예상하지만, 실제로는 그런 것이 전혀 필요하지 않았다는 것이 FAR.AI가 확인한 내용입니다. 이미 안전 정렬이 제거된 변형 모델을 검색해 내려받거나, 공개된 프롬프트 기반 탈옥을 그대로 쓰는 것만으로도 가능했습니다.
탈옥세(jailbreak tax)가 무엇이고 왜 중요한가요?
탈옥에 성공하더라도 그 과정에서 모델의 능력이 함께 손상되는 현상을 가리킵니다. 앤트로픽의 최근 논문에서 모델이 강해질수록 이 현상이 사라진다는 결과가 나왔고, FAR.AI가 공개 가중치 모델 쪽에서 확인한 결과도 이와 일치했습니다. 일부 탈옥은 능력을 떨어뜨리지만, 능력을 유지한 채 탈옥하는 것도 충분히 가능하다는 뜻입니다.
대응책으로 무엇이 제시되나요?
기술적으로는 위험한 능력을 통제하기 위한 사전학습 데이터 필터링, 그리고 특정 능력을 하나의 전문가 모듈에 집중시켰다가 그 모듈을 제거하는 그래디언트 라우팅 같은 방향이 유망하다고 봅니다. 정책 측면에서는 위험에 대한 이해와 위험 모델링, 정보 확산과 합의 형성, 더 나은 평가와 시험을 통한 취약점 발견·수정이 함께 거론됩니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗