AI VIDEO BRIEFING
공개 가중치 모델 안전성 — 학습 데이터 필터링으로 생물학 위험 지식을 제거한 EleutherAI 연구
EleutherAI 스텔라 비더만이 옥스퍼드·영국 AISI와 함께한 연구를 소개한다. 사전학습 데이터에서 생물학 위험 지식을 걸러낸 모델은 적대적 파인튜닝에도 오래 버텼지만, 이 방식이 통하는 조건은 생각보다 좁았다.

핵심 메시지
쉽게 이해하기
발표자는 지금까지 쌓인 AI 안전 연구가 사실상 전부 API로 제공되는 모델을 염두에 두고 발전해 왔다는 점을 문제의 출발점으로 삼는다. 현재 대부분의 조직이 기대는 수단은 세 가지다. 입력과 출력을 걸러내는 방식, 정렬 파인튜닝, 그리고 사용 모니터링과 고객 확인 절차다.
그런데 이 세 가지는 공개 가중치 모델 앞에서 차례로 무너진다. 입출력 필터링은 모델을 닫아 걸어야 하므로 오픈소스 진영의 지향과 철학적으로 어긋나고, 정렬 파인튜닝은 누구나 다시 파인튜닝할 수 있는 모델에서는 기술적으로 그다지 효과가 없다는 사실이 이미 널리 알려져 있다. 사용 모니터링과 고객 확인 역시 공개 가중치에는 적용할 방법이 마땅치 않다.
발표자는 그래서 공개 가중치 모델을 만드는 사람들의 관점과 필요에서 출발해야 한다고 강조한다. 모델을 닫아야만 성립하는 기법을 들이밀면 받아들여질 리 없기 때문이다. 공개 가중치 안전 문제의 해법으로 '공개 가중치 모델을 만들지 않으면 된다'는 제안이 흔히 나오지만, 발표자가 보기에 그것은 문제를 푸는 것이 아니다.
연구팀이 택한 접근은 단순하다. 생물무기 관련 지식은 매우 좁고 널리 쓰이지도 않는 종류의 정보이니, 학습 데이터를 들여다보고 그냥 다 빼 버리자는 것이다. 실제로 DCLM 데이터로 세 개의 모델을 처음부터 학습시켰다. 하나는 데이터 전체를 쓴 기준 모델이고, 나머지 둘은 단순한 차단 목록을 쓴 강한 필터 모델과 거짓 양성으로 걸러진 데이터를 일부 되돌린 모델이다.
결과는 두 필터링 모델 모두 WMDP-Bio로 측정한 생물학 위험 응답 능력이 크게 낮아졌고, 이 효과가 적대적 파인튜닝을 거쳐도 상당히 오래 유지된다는 것이었다. 기준 모델 수준으로 성능을 되돌리려면 강하게 필터링한 모델 기준으로 1억 5천만 토큰가량을 더 학습시켜야 했다. 발표자는 이 수치에 두 가지 반응이 가능하다고 말한다. 겨우 1천 달러 정도밖에 안 드는 것 아니냐는 반응, 그리고 다른 어떤 방법보다 한 자릿수 이상 견고한 것 아니냐는 반응인데, 둘 다 맞다는 것이다.
발표자가 특히 흥미롭게 본 지점은 파인튜닝을 계속해도 능력이 그다지 더 올라가지 않는다는 것이다. 적대적 파인튜닝을 두 배로 늘린 경우에도 강하게 필터링한 모델은 37% 언저리에 머물렀다. 다만 발표자는 이 기법이 대부분의 문제에는 통하지 않을 것이라고 스스로 못 박으며, 통할 만한 문제를 골라서 실험한 것이라고 밝힌다.
주요 인사이트
- 안전 기법은 배포 형태를 전제로 설계된다. API 모델용으로 만들어진 도구를 공개 가중치 모델에 그대로 옮기면 철학적으로도 기술적으로도 어긋난다.
- 견고성은 '막았느냐'가 아니라 '되돌리는 데 얼마가 드느냐'로 측정된다. 1천 달러라는 공격 비용 자체는 낮지만, 다른 기법 대비 열 배 이상이라는 상대적 위치가 이 연구의 성과다.
- 회복 곡선이 평평해진다는 점이 절대 수치보다 중요할 수 있다. 파인튜닝을 두 배로 늘려도 성능이 거의 오르지 않았다는 것은, 데이터에서 지운 지식이 단순히 잠겨 있는 게 아니라는 신호다.
- 발표자는 AI 모델에도 일종의 '자연종'에 해당하는 개념 경계가 있는 듯하다고 말한다. 무엇을 어느 선에서 잘라내야 하는지 그 경계를 찾는 일이 필터링 설계의 핵심이 된다.
- 지식을 지우는 것이 늘 안전으로 이어지지는 않는다. 안전하게 행동하려면 위험한 행동이 무엇인지 알아야 하는 영역이 분명히 존재한다.
자주 묻는 질문
정렬 파인튜닝으로는 왜 공개 가중치 모델을 안전하게 만들 수 없나요?
가중치가 공개되면 누구나 그 모델을 다시 파인튜닝할 수 있기 때문입니다. 발표자는 이 한계가 이미 꽤 잘 알려진 사실이며 여러 발표자가 언급했다고 말합니다.
실험에서 필터링은 구체적으로 어떻게 했나요?
DCLM 데이터로 세 개의 모델을 처음부터 학습시켰습니다. 하나는 데이터 전체를 쓴 기준 모델이고, 나머지 둘은 단순한 차단 목록을 적용한 강한 필터 모델과 거짓 양성으로 걸러진 데이터를 일부 되돌린 모델입니다.
이 방법을 어떤 위험에나 쓸 수 있나요?
아닙니다. 발표자는 세 가지 조건을 제시합니다. 지우려는 능력이 개념적으로 분리돼 명확히 식별·제거 가능해야 하고, 모델이 빠진 부분을 메워 복원하기 어려워야 하며, 그 지식을 모르는 상태가 실제 안전과 어긋나지 않아야 합니다. 현재로선 대략 CBRN 정보 정도에 특히 잘 맞을 것으로 봅니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗