AI VIDEO BRIEFING

AI 보안 에이전트 평가법: 정밀도·재현율 대신 근거 수집과 추론 과정을 루브릭으로 채점해야 하는 이유

메타에서 AI 보안을 이끈 조슈아 색스가 보안 에이전트 평가의 한계를 짚었다. 라벨 자체가 흔들리는 보안 영역에서 정밀도·재현율 대신 근거 수집과 추론 품질을 채점하는 루브릭이 필요하다는 주장이다.

사이버 방어를 AI 에이전트에 맡기려면, 정답률이 아니라 판단 과정을 평가해야 한다 영상 대표 이미지

핵심 메시지

  • 공격 비용이 낮아지면서 조직은 경보 조사·권한 관리·코드 패치 같은 민감한 결정을 AI 에이전트에 맡길 수밖에 없어진다.
  • 보안 데이터의 정답 라벨은 분석가끼리도 두 자릿수 비율로 의견이 갈릴 만큼 흔들려, 정밀도·재현율 같은 고전 지표의 신뢰도를 떨어뜨린다.
  • 라벨에 1~3%의 오류만 섞여도 완벽한 시스템조차 부정확해 보이고, 성능 개선을 측정할 수 없는 잡음 천장이 생긴다.
  • 에이전트를 사람 채용하듯 평가해, 근거 수집·정책 이해·1차 원리 추론·설명 품질을 루브릭으로 채점하는 방식이 대안으로 제시됐다.
  • 평가 체계가 갖춰지면 그 지표를 언덕 오르기 목표로 삼아 프롬프트·구조를 자동 최적화하는 것도 가능해진다.

쉽게 이해하기

2026년 [un]prompted 컨퍼런스에서 조슈아 색스는 사이버 보안의 자율 시스템을 어떻게 검증할 것인가를 주제로 발표했다. 그는 약 4년간 메타에서 AI 보안 업무를 기술 리드로 이끌었고, 발표 직전 창업한 스타트업으로 자리를 옮긴 상태라고 밝혔다. 발표의 출발점은 공격 측이 곧 직접 손을 대는 작업자에서 AI 에이전트를 관리하는 관리자로 바뀔 것이라는 전망이다.

보안 인력이 부족한 조직일수록 자율 방어 시스템에 기대야 하는데, 문제는 그 시스템이 실제로 작동하는지 확인할 방법이다. 색스는 수백억 개 파라미터를 가진 신경망의 내부를 들여다보는 해석 연구보다, 행동을 통계적으로 관찰하는 접근이 현실적인 선택지라고 봤다. 그리고 이 평가 문제가 코드 자동 수정, 경보 처리, 접근 권한 관리, 클라우드 설정 점검 등 자율화가 논의되는 모든 영역의 공통 병목이라고 진단했다.

그가 지적한 근본 원인은 정답 자체가 불확실하다는 점이다. 고양이와 개를 구분하는 문제처럼 라벨이 투명한 환경을 전제로 만들어진 정밀도·재현율·ROC 곡선 같은 지표를 보안에 그대로 가져왔지만, 패치가 실제로 동작하는지, 어떤 실행 파일이 악성인지는 이론적으로도 판단이 어렵다. 실제로 보안 관제 경보를 조사할 가치가 있었는지, 특정 계정이 민감한 데이터에 접근해도 되는지를 두고 담당자들의 판단은 두 자릿수 비율로 엇갈린다고 그는 경험을 전했다.

색스는 라벨에 잡음을 주입하는 간단한 시뮬레이션으로 이 문제를 보여줬다. 참·거짓 라벨이 0.5%에서 3%까지 뒤집히도록 설정하자, 완벽하게 예측하는 가상의 시스템조차 측정치가 급격히 나빠졌고 일정 수준 위로는 개선 여부를 확인할 수 없는 천장이 생겼다. 10만 토큰에 이르는 추론과 도구 호출 끝에 내린 판단을 단 한 비트의 정답·오답으로 압축하는 것이 지금의 평가 방식이라는 비유도 덧붙였다.

대안으로 그가 제시한 것은 에이전트를 불확실성 속에서 결정을 내리는 사람처럼 면접 보는 방식이다. 결론만 보지 말고 필요한 근거를 모았는지, 정책을 이해했는지, 1차 원리에서 추론했는지, 감사 가능한 형태로 설명했는지를 사전에 정의한 루브릭으로 채점하고, 그 채점을 대규모로 자동화하기 위해 심사용 모델을 보정해 쓴다. 그는 100개 남짓한 표본으로도 심사 모델 보정을 시작할 수 있으며, 배치 기준선을 경영진과 합의해 두면 그 선을 넘긴 시점에 실제로 배치하고 운영 중 이상 여부를 계속 관찰할 수 있다고 설명했다.

주요 인사이트

  • 평가가 어려운 이유를 데이터 부족이 아니라 환경 자체의 불확실성으로 규정한 점이 핵심이다. 노력을 더 들여도 정답이 확정되지 않는 영역에서는 지표를 정교하게 다듬는 대신 지표의 종류를 바꿔야 한다.
  • 여러 차원을 함께 보면 각 지표가 다소 흔들리더라도 시스템이 실제로 작동하는지에 대해 더 완전한 그림이 만들어진다는 것이 색스의 주장이다. 단일 지표를 두고 모델이 틀렸는지 라벨이 틀렸는지 다투는 소모를 줄이는 효과도 있다.
  • 평가에 팀 시간의 절반 이상이 들어가지만 결과적으로 10배 빨리 움직이게 된다는 현장 경험은, 평가 투자를 비용이 아니라 배포 속도의 전제로 보게 만든다.
  • 루브릭 설계에는 깊은 도메인 전문성이 필요한 반면 통계 자체는 교과서 수준에서 달라지지 않는다는 구분도 실무적으로 유용하다. 사람을 채용할 때 요구하는 수준의 전문성을 평가 기준 설계에 투입하라는 조언이다.
  • 질의응답에서는 사람 검토자들의 의견이 갈리는 사례일수록 불확실성을 크게 두고, 세 명이 모두 동의한 사례에 더 큰 가중치를 주는 베이지안 보정 방식이 언급됐다.

자주 묻는 질문

보안 분야에서 정밀도·재현율 같은 지표가 문제가 되는 이유는 무엇인가요?

이 지표들은 정답 라벨이 투명하다는 전제 위에 만들어졌습니다. 그러나 보안에서는 어떤 경보가 조사할 가치가 있었는지, 누가 민감한 데이터에 접근해도 되는지를 두고 담당자들의 판단이 두 자릿수 비율로 엇갈립니다. 라벨 자체가 흔들리면 그 위에서 계산한 요약 통계도 신뢰하기 어려워집니다.

라벨에 섞인 잡음은 측정에 얼마나 영향을 주나요?

발표에서 소개된 시뮬레이션에서는 라벨의 0.5%에서 3%가 뒤집히도록 설정했습니다. 그러자 완벽하게 예측하는 가상의 시스템조차 부정확해 보였고, 일정 수준 위로는 성능이 나아졌는지 확인할 수 없는 잡음 천장이 나타났습니다.

대안으로 제시된 평가 방식은 구체적으로 어떤 모습인가요?

결론의 정오만 보지 않고 근거 수집, 정책 이해, 1차 원리 추론, 설명과 로그의 감사 가능성 같은 항목을 미리 정의한 루브릭으로 채점합니다. 사람이 모든 기록을 검토할 수는 없으므로 심사용 모델을 보정해 자동화하고, 배치 기준선을 넘긴 뒤에도 운영 중 행동을 계속 관찰합니다.

원문과 출처

이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.

YouTube 원본 영상 보기 ↗

관련 AI 소식