AI VIDEO BRIEFING
멀티 에이전트 AI 안전성, 조직 경계를 넘는 에이전트 위험과 세 가지 거버넌스 계층
그래디언트 인스티튜트 앨리스터 리드가 AI 안전 포럼에서 조직 경계를 넘는 멀티 에이전트 위험을 세 가지 거버넌스 계층으로 정리하고, 개별 에이전트의 안전이 시스템 안전을 보장하지 않는 이유를 설명했다.

핵심 메시지
쉽게 이해하기
그래디언트 인스티튜트의 앨리스터 리드는 AI 안전 포럼 2026에서 호주 AI 안전 연구소와 공동으로 준비 중인 보고서를 미리 소개했다. 아직 발표 전인 이 보고서는 한 조직이 관리하는 에이전트가 다른 조직의 에이전트와 상호작용하는 멀티 에이전트 환경에 놓였을 때 어떤 위험이 생기는지를 다룬다. 논문 검토뿐 아니라 업계 관계자 인터뷰를 함께 진행했다고 밝혔다.
그는 멀티 에이전트를 단순히 에이전트가 여러 개 있는 상태가 아니라, 서로 의미 있게 연결된 상태로 정의했다. 통신 프로토콜이나 구조화된 인수인계, 오케스트레이터의 작업 위임 같은 직접 연결도 있고, 같은 코드베이스에서 작업하거나 같은 파일 시스템을 읽고 쓰거나 같은 마켓플레이스에서 경쟁 입찰을 내는 간접 연결도 있다. 연결되는 순간 출력이 서로 얽히고 행동은 개별 합보다 커지는데, 리드는 이를 개미에 비유했다. 개미 한 마리는 똑똑하지 않지만 여럿이 다리를 만들면 개별 개미가 풀 수 없는 문제를 해결하고, 반대로 서로를 따라 원을 그리며 끝없이 도는 '개미 맴돌이(ant mill)'처럼 개별 개체에는 없던 실패도 창발한다.
첫 번째 계층인 단일 거버넌스는 한 조직이 모든 에이전트를 소유하고 관리하는 경우다. 통제와 검사, 테스트 권한이 전부 자기 손 안에 있어 가장 다루기 쉽지만 결코 쉬운 문제는 아니다. 자연어로 인수인계가 오가면 해석이 어긋날 수 있고, 같은 모델과 같은 프롬프트를 쓰는 에이전트들은 동일한 오류를 독립적으로 저지르거나 한 에이전트의 오류에 동의해버려 '합의는 곧 신뢰할 만한 판단'이라는 전제가 무너진다.
두 번째 연합 거버넌스는 서로 다른 조직의 에이전트가 합의된 틀 안에서 상호작용하는 경우다. 리드는 항공 관제를 비유로 들며 시드니에서 싱가포르로 가는 비행기가 관제 시스템 호환을 걱정하지 않는 이유는 국제적으로 공유된 거버넌스 체계가 있기 때문이라고 설명했다. 보고서는 참여 조건을 규정하는 합의 계층과, 신원 서비스·평판 메커니즘·도구 레지스트리처럼 에이전트가 접속해 쓰는 인프라 계층으로 이 틀을 나눴다.
세 번째 개방 환경은 중앙 권위가 없어 가장 다루기 어렵다. 업계와 안전 커뮤니티의 전망은 두 갈래로 갈렸다. 하나는 낯선 상대와 연결되니 권한과 범위를 좁혀 통제 가능한 저자율 에이전트로 가자는 방향이고, 다른 하나는 높은 자율성을 유지하되 자발적 표준과 분산 공공 인프라에 기대 신뢰할 수 있는 상대를 찾아내자는 다중심적(polycentric) 거버넌스 방향이다.
주요 인사이트
- 발표자가 든 미조정 사례는 풍력 발전사다. 오후 3시에 강풍이 예보되면 정비 담당 에이전트는 여유 용량이 생겼으니 터빈 한 대를 세울 좋은 시점이라 판단하고, 공급 입찰 에이전트는 그 여유 용량을 팔겠다며 큰 입찰을 넣는다. 각각은 합리적이지만 동시에 실행되면 이행할 수 없는 입찰이 되어 정전으로 이어질 수 있다.
- AI 빌리지 사례는 오류가 어떻게 굳어지는지를 보여준다. 한 에이전트가 존재하지 않는 연락처 목록을 있다고 환각했고, 다른 에이전트가 빈 목록을 만들어 응답하면서 네 개의 에이전트가 나흘 동안 '손상된 목록'을 복구하려 매달렸다. 사람이 목록이 없다고 알려주는데도 잘못된 믿음이 공유된 전제로 굳어진 것이다.
- 연합 계층에서는 명시적 담합 메시지 없이도 암묵적 담합이 생길 수 있다. 상대가 가격 인상을 따라오고 제재하지 않는다는 것을 관찰하기만 해도, 주인이 지시하지 않은 담합 전략이 실행 시점에 스스로 나타날 수 있다.
- JSON 스키마를 쓴다고 의미 불일치가 해결되지는 않는다. 스키마 안쪽에서 어긋나기 때문이다. 발표자는 배송일 '03 07 26'과 수량 18이라는 주문을 예로 들며, 날짜 표기와 단위 관행이 다르면 3월 7일 18봉지와 7월 3일 18상자라는 전혀 다른 주문이 된다고 지적했다.
- 개방 환경의 평판 시스템 자체가 공격 대상이 된다. 한 에이전트가 여러 신원을 등록할 수 있다면 그 가명들이 서로를 보증해 평판 점수를 조작하고 다른 에이전트로부터 부당한 신뢰를 얻는 시빌 공격이 가능하다.
자주 묻는 질문
발표에서 말하는 '멀티 에이전트 시스템'의 기준은 무엇인가요?
에이전트가 여러 개 있다는 것만으로는 부족하고, 서로 의미 있게 연결되어 있어야 합니다. 통신 프로토콜이나 구조화된 인수인계, 오케스트레이터의 작업 위임 같은 직접적인 연결이거나, 같은 코드베이스·파일 시스템을 공유하거나 같은 마켓플레이스에서 경쟁하는 것처럼 공유 환경을 통한 간접적 연결이면 됩니다.
세 가지 거버넌스 계층은 어떻게 구분되나요?
두 에이전트와 그 연결을 함께 묶는 최소 공통 거버넌스가 무엇인가를 기준으로 나눕니다. 단일 거버넌스는 한 조직이 모든 에이전트를 소유·관리하는 경우, 연합 거버넌스는 여러 조직이 공유된 틀 아래 움직이는 경우, 개방 환경은 규칙을 정할 중앙 권위가 없고 표준 채택이 자발적인 경우입니다.
단일 조직이 모든 에이전트를 관리하면 안전한가요?
가장 다루기 쉬운 계층이지만 안전이 보장되는 것은 아닙니다. 시스템 전체에 대한 통제권이 있어도 창발적 행동, 자연어 인수인계에서 생기는 해석 불일치, 에이전트 단위 검증만으로는 잡히지 않는 오류의 전파와 증폭이 여전히 남습니다. 발표자는 단일 에이전트 위험 자체도 아직 미해결 영역이라고 덧붙였습니다.
연합 거버넌스의 '합의 계층'과 '인프라 계층'은 무엇이 다른가요?
합의 계층은 참여 조건에 해당합니다. 각 회사의 에이전트가 구현해야 할 표준, 공개해야 할 정보, 공동 테스트 같은 참여 활동을 규정하며 에이전트를 배포하는 조직들을 묶습니다. 인프라 계층은 에이전트가 직접 접속해 쓰는 서비스로, 신원 서비스나 평판 메커니즘, 도구 레지스트리처럼 신뢰와 조정을 가능하게 하는 공용 기반입니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗