AI VIDEO BRIEFING
AI 에이전트를 게임 엔진에서 검증하기: 고전 게임 둠으로 만든 관측 가능한 에이전트 구조
제약사 데이터 엔지니어가 고전 게임 둠에 천 개 규모의 에이전트를 붙여 만든 실험 사례를 통해, 게임 엔진이 왜 에이전트 시스템을 관찰하고 검증하기에 좋은 시험대가 되는지 구조 단위로 살펴봅니다.

핵심 메시지
쉽게 이해하기
발표자는 제약회사에서 신약 연구개발용 도구를 만드는 데이터 엔지니어다. 본업과는 별개로, 에이전트를 어떻게 설계하고 검증할 수 있는지 실험하기 위해 고전 게임 둠을 시험대로 골랐다. 게임 자체를 만드는 것이 목표가 아니라 그 위에 얹은 구조가 발표의 핵심이며, 게임의 그래픽과 캐릭터는 기존 모드 제작자들의 작업물이라는 점도 분명히 밝힌다.
출발점은 에이전트 시스템이 일반 소프트웨어와 다르다는 인식이다. 입력과 출력이 정해진 프로그램과 달리 에이전트는 상태, 행동, 환경, 되먹임의 순환 속에서 행동이 만들어진다. 언어모델이 판단의 중심에 있으니 결과가 결정적이지 않고, 결정의 사슬이 길어 파급 효과가 누적되며, 여러 에이전트가 서로 이야기하면서 예상 밖의 행동이 생긴다. 그래서 실제 시스템에 배포하기 전에 행동을 관찰하고 규율할 방법이 필요하다.
게임 엔진이 답이 된 이유는 이미 필요한 것들을 갖고 있기 때문이다. 초당 서른다섯 번의 고정 틱은 결정적인 스케줄링을 보장하고, 상태 기계 기반의 등장인물, 물리·충돌·시야 판정 같은 실시간 되먹임, 모든 행위자가 공유하는 세계 상태, 시간 순서가 있는 사건 체계가 그대로 제공된다. 다만 원래의 둠은 바깥 세계와 대화할 수단이 부족해 외부와 통신할 수 있도록 손본 버전을 썼다.
구조는 세 층이다. 아래층은 보이는 행위자마다 위치·체력 같은 상태를 초당 일곱 번쯤 따라가는 값싼 관측자 무리이고, 가운데는 '산탄총', '위험', '탄약 부족' 같은 이름표를 붙이는 소수의 해석기다. 이 층은 비싸서 결과를 캐시한다. 맨 위는 그 거울을 읽고 실제로 움직이는 천 개 규모의 에이전트 무리다. 화면을 캡처해 외부 모델에 보내 물체를 알아보게 하는 시각 파이프라인은 응답에 몇 초씩 걸려, 같은 장면을 다시 묻지 않도록 의미 기반 캐시를 두어 비용을 세 배가량 줄였다고 한다.
행동 쪽에서는 에이전트마다 정책을 안에 품게 해서 바깥에서 강제하지 않아도 스스로 허용 범위를 지키게 했고, 모든 사건을 구조화해 기록하고 다시 재생할 수 있게 만들었다. 발표자는 이 설계가 게임에만 쓰이는 것이 아니라고 강조하며, 자신이 일하는 제약 분야의 디지털 트윈, 즉 분자나 인체를 모사해 미리 시험해 보는 방식과 같은 발상이라고 연결한다.
주요 인사이트
- 여기서 언어모델은 계획을 세우는 주체가 아니라 의미를 붙이는 해석기다. 계획과 상태 전이는 값싼 결정적 상태 기계가 맡고, 모델은 '저건 무엇인가'에만 답한다.
- 빠른 층과 느린 층을 나누는 것은 성능 최적화가 아니라 설계 원칙이다. 나누지 않으면 초당 서른다섯 틱으로 도는 세계를 몇 초씩 걸리는 추론이 따라잡지 못한다.
- 비용을 어디로 보낼지 정하는 라우팅은 예산 검토가 아니라 아키텍처 요소로 다뤄야 한다. 의미 캐시와 로컬 모델을 앞에 두고 외부 모델은 마지막에 부르는 식이다.
- 발표자는 관측 가능·귀속 가능·재현 가능이라는 세 가지 불변 조건이 설계 결정을 이끈다고 본다. 모델이 매번 같은 답을 내지 않아도, 어떤 정책을 적용했고 무엇을 실행하려 했는지는 항상 같아야 한다.
- 장면이 바뀌면 캐시가 듣지 않는다는 점이 이 구조의 실질적 한계다. 이미 본 방에서는 즉시 응답하지만 새 방에 들어가면 다시 십여 초를 기다리게 된다.
자주 묻는 질문
왜 하필 게임에서 에이전트를 실험하나요?
에이전트의 행동은 코드에 적힌 대로가 아니라 환경과 주고받는 과정에서 나옵니다. 게임 엔진은 고정된 틱 주기, 상태 기계로 움직이는 등장인물, 물리와 시야 판정 같은 실시간 되먹임, 모든 참여자가 공유하는 세계 상태와 시간 순서가 있는 사건 체계를 이미 갖고 있어서, 그 행동을 관찰하고 되풀이해 볼 수 있는 통제된 환경이 됩니다.
천 개의 에이전트가 모두 언어모델을 부르나요?
아닙니다. 대부분은 언어모델 없이 도는 가벼운 상태 기계이고, 언어모델을 부르는 것은 화면 속 대상을 해석하는 소수의 해석기입니다. 게다가 같은 장면은 의미 기반 캐시에서 꺼내 쓰기 때문에 외부 모델 호출은 훨씬 줄어들며, 발표자는 한 판을 도는 데 드는 비용을 몇 달러 수준으로 이야기합니다.
이 구조가 게임 밖에서는 어떻게 쓰이나요?
발표자는 게임의 구성 요소를 실무 시스템에 하나씩 대응시킵니다. 고정 틱은 정해진 간격의 에이전트 스케줄링, 상태 전이는 업무 흐름 상태 기계, 정책 가드는 권한 정책 엔진, 구역 경계는 인가 도메인, 구조화된 사건 기록은 로깅, 재생 저장소는 감사 추적에 해당합니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗