AI VIDEO BRIEFING
AI 에이전트가 짠 게임 전략 대결: 에이지 오브 엠파이어 2로 모델 성능 비교하기 실험
한 개발자가 30년 가까이 된 실시간 전략 게임의 내장 스크립트 언어로 AI 모델들에게 전략을 짜게 하고 서로 붙였다. 라운드를 거듭하며 나아진 결과와 밤새 돌린 자동 토너먼트 실험의 한계까지 정리했다.

핵심 메시지
쉽게 이해하기
'에이전트를 시켜 에이전트를 프로그래밍하고, 그 결과물끼리 싸우게 한다.' 유튜브 채널 이머전트 가든이 30년 가까이 된 실시간 전략 게임 에이지 오브 엠파이어 2에서 벌인 실험은 이 한 줄로 요약된다. 여기서 중요한 것은 모델이 실시간으로 부대를 조작하는 것이 아니라는 점이다. 모델은 미리 전략 스크립트를 짜 두고, 경기 중에는 그 스크립트가 부대를 움직인다.
이 실험이 가능한 이유는 게임 자체에 AI 스크립트 언어가 들어 있기 때문이다. 게임 폴더의 AI 디렉터리에 파일을 하나 추가하면 게임 안에서 바로 선택할 수 있다. 다만 언어가 상당히 제한적이다. 반복문도 함수도 클래스도 없이 '인구 여유가 부족하면 집을 지어라' 같은 조건문 뭉치에 가깝다. 제작자는 이 때문에 복잡한 전략을 짜기 어렵지만, 그럼에도 사람들이 꽤 강한 봇을 만들어 왔다고 설명한다.
그는 코딩 에이전트들을 이 폴더에 붙여 기존 전략 파일을 읽게 한 뒤 각자 새 전략을 처음부터 만들게 했다. 기존 파일을 복사하거나 남의 스크립트를 건드리는 것은 금지했는데, 방법은 그러지 말아 달라고 정중히 부탁하는 것뿐이었다. 스크립트 오류를 잡는 데 몇 번의 시도가 필요했지만 결국 네 모델의 봇이 모두 정상 실행됐고, 각각 다른 문명을 맡아 4인 대결을 벌였다.
첫 판의 결과는 좋지 않았다. 네 모델 모두 일꾼을 계속 뽑고 자원을 모으는 데 치중하다가 시대 발전과 군사 생산을 놓쳤고, 한 모델은 끝내 첫 시대를 벗어나지 못했다. 사냥감을 쫓아 지나치게 멀리 이동하는 낭비도 공통으로 나타났다. 그나마 클로드가 만든 봇이 경제를 굴려 최종 시대까지 올라가고 군대를 보내 이웃을 괴롭혔으며, 지도의 유물을 모두 모아 승리를 가져갔다. 이후 문제점을 알려주고 경기 통계를 검토하게 하자 두 번째 판에서는 모두가 첫 시대를 넘겼고, 세 번째 판은 그보다 더 나아졌다.
제작자는 여기서 한 걸음 더 나아가 사람이 개입하지 않는 자동 개선 루프를 만들었다. 마우스를 직접 움직여 경기를 설정하고 화면을 읽어 결과를 확인하는 오래된 공개 도구를 손봐, 새 전략과 직전 우승 전략, 그리고 최고 난이도의 기본 AI를 붙여 토너먼트를 돌리게 했다. 새 전략이 더 나쁘면 버리고 이전 우승자를 남기는 방식이라 개선이 뒤로 가는 일을 막을 수 있다. 밤새 돌린 결과 기본 AI보다 조금 나은 전략을 찾아냈지만, 그는 개선 폭이 작다고 솔직하게 평가한다.
주요 인사이트
- 제작자는 이 방식을 '유전 프로그래밍'으로 설명한다. 가장 좋은 해답에 조금씩 변형을 가하고 다시 최고를 고르는 구조인데, 변형을 무작위가 아니라 언어 모델이 만든다는 점이 다르다. 그만큼 성능이 좋아질 확률이 높다.
- 이 게임이 이 방법에 잘 맞지는 않는다는 점도 분명히 한다. 경기가 길고 두 배속이 한계라 토너먼트 한 번에 몇 시간이 걸리며, 병렬로 돌릴 수도 없고 무작위성이 커서 결과를 믿기 어렵다. 그는 체스나 바둑처럼 짧고 변수가 적은 게임에 같은 알고리즘이 더 어울릴 것이라고 본다.
- 실제로 비용의 대부분은 모델 호출이 아니라 경기 시간이었다. 값싼 모델을 밤새 돌린 전체 비용은 15달러 정도였다고 한다.
- 찾아낸 전략의 개선은 주로 병력 구성에서 나왔다. 반면 마지막에 시도한 소규모 대결에서는 기본 AI를 거의 그대로 베끼고 적을 고르는 방식만 살짝 바꾼 전략이 나왔고, 제작자는 스크립트 언어가 부대 조작을 세밀하게 다루기에는 너무 뭉툭하다고 진단한다.
- 그는 에이전트를 다루는 일이 이 게임과 닮았다고 말한다. 여러 일꾼을 각자 일하게 두고 큰 방향만 잡다가 가끔 직접 개입하는 구조가 비슷하다는 것이다. 다만 실제 업무는 훨씬 복잡하고 제각각이라, 전략 게임 같은 화면으로 에이전트를 부리는 인터페이스가 실용적이기는 어려울 것이라고 덧붙인다.
자주 묻는 질문
AI 모델이 게임을 실시간으로 조작하나요?
아닙니다. 모델은 경기 전에 전략 스크립트를 작성할 뿐이고, 경기 중에는 그 스크립트가 부대를 움직입니다. 따라서 순간적인 조작 실력이 아니라 전략을 설계하고 경제와 군사를 계획하는 능력을 비교하는 실험에 가깝습니다.
모델들이 공통으로 저지른 실수는 무엇이었나요?
일꾼을 계속 뽑고 자원을 모으는 데 치우쳐 다음 시대로 올라갈 자원을 남기지 못한 점입니다. 그 결과 시대 발전과 군사 생산이 늦어졌고, 사냥감을 찾아 멀리 이동하며 시간을 낭비하는 모습도 공통으로 나타났습니다.
자동 개선 루프는 어떻게 동작하나요?
에이전트가 새 전략을 만들면, 마우스를 자동으로 조작하는 도구가 경기를 열어 새 전략과 직전 우승 전략, 최고 난이도 기본 AI를 맞붙입니다. 화면 캡처와 기록 파일에서 오류와 통계를 읽어 승자를 정하고, 그 승자가 다음 라운드의 기준이 됩니다.
이 실험의 한계는 무엇인가요?
제작자 스스로 엄밀하지 않은 실험이라고 밝힙니다. 경기가 길어 반복 횟수를 늘리기 어렵고 무작위성이 커서 우연한 결과가 섞이며, 지도에 따라 특정 위치가 유리한 문제도 있었습니다. 개선이 확인되긴 했지만 폭은 작았습니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗