AI VIDEO BRIEFING
AI 에이전트 평가(Eval) 완전정리 — 단위·통합·온라인 평가와 벤치마크의 차이
비결정적인 AI 에이전트의 동작을 어떻게 측정할까. 소프트웨어 테스트에 빗대어 단위·통합·온라인 평가와 벤치마크를 트레이스와 LLM 심판 개념으로 풀어냅니다.

핵심 메시지
쉽게 이해하기
발표자는 에이전트 평가가 어렵게 느껴지는 이유를 짚으며, 이를 소프트웨어 엔지니어링의 익숙한 용어로 재구성합니다. 함수가 기대대로 동작하는지 단언(assert)하던 전통적 테스트와 달리, 에이전트의 동작은 여러 변수에 의존하고 비결정적입니다. 그래서 '무엇을, 어떻게 측정하는가'를 먼저 정의해야 합니다.
측정의 대상이 되는 산출물은 트레이스입니다. 에이전트가 한 번 실행될 때의 입력·출력·중간 단계와 환경 메타데이터를 모두 담은 로그로, 관측성 플랫폼의 span에 해당합니다. 트레이스 안의 개별 단계는 run, 같은 맥락에서 이어지는 여러 트레이스는 thread라 부르며, 챗봇처럼 사용자가 다시 메시지를 보내면 새로운 트레이스가 쌓입니다. 채점은 크게 '옳은 단계를 밟았는가(step)'와 '출력이 좋은가(content)'로 나뉘고, 각각을 결정적 방식(도구 호출·인자 정확 일치 같은 단언)과 확률적 방식(LLM as a judge)으로 잽니다. 여러 차원을 가중합해 0~1로 정규화한 하나의 점수(reward)로 묶은 것이 루브릭입니다.
첫째 유형인 단위 테스트 평가(행동 단위 테스트)는 특정 조건에서 원하는 다음 단계가 나오는지를 단언합니다. 원하는 행동이 일어나는 트레이스를 찾아 그 직전까지의 입력·환경을 재구성한 뒤 딱 한 단계만 실행합니다. 예컨대 전자상거래 고객응대 에이전트가 주문번호와 환불 요청을 받으면 process_return 도구를 정확한 인자로 호출하는지 확인하는 식으로, 이는 곧 회귀 테스트가 됩니다. 둘째 통합(엔드투엔드) 테스트는 중간 과정이 아니라 최종 산출물에 집중합니다. 딥리서치 에이전트가 실제 도구를 다 써서 만든 보고서의 구조를 단언하거나, LLM 심판으로 품질을 채점하거나, 준비해 둔 모범 보고서와 비교합니다.
셋째 온라인 평가는 고정된 데이터셋이 아니라 실사용자와의 실시간 상호작용에 대해 돌립니다. 관측성에 가까워, 매 트레이스에 함수·코드·LLM 심판 평가를 적용하고 시간축 위에 점수를 찍어 추세와 이상치를 봅니다. 예로 영업 아웃리치 에이전트의 턴 수, 이메일 글자 수, 어조(전문성)를 각각 함수와 LLM 심판으로 재고, 프롬프트 변경으로 이메일이 갑자기 짧아지면 추세 하락으로 드러납니다. 트래픽이 많으면 특히 토큰을 쓰는 LLM 심판은 일부 트레이스만 샘플링해 돌리는 전략도 권합니다.
넷째 벤치마크는 구현 방식과 분리해 '역량' 자체를 측정합니다. SweBench는 2,000여 개 과제로 코드베이스·깃허브 이슈·정답 PR을 묶고, 시작 상태에서 실패하다가 정답 PR을 적용하면 통과하는 테스트 묶음으로 채점합니다. 벤치마크의 구성 요소는 역량, 대표성 있는 과제 분포, 정답(ground truth), 채점 방법입니다. 금융 감사 에이전트라면 알려진 불일치를 심은 문서들을 난이도·주제별로 만들어 정밀도·F1 등으로 채점합니다. 벤치마크는 에이전트 간 객관적 비교 기준과 개선/퇴행 신호를 동시에 주지만, 역량을 정확히 대표하도록 설계하기가 매우 어렵습니다.
주요 인사이트
- 트레이스·run·thread라는 데이터 모델을 먼저 정의하면, 평가는 '그 트레이스의 어느 부분을 어떤 방식으로 채점하느냐'의 문제로 단순해진다.
- 단위 테스트는 개별 행동을 고정(회귀 방지)하고, 통합 테스트는 엔드투엔드 결과를 검증하며, 온라인 평가는 라이브 성능을 감시하고, 벤치마크는 최적화의 북극성을 준다 — 넷은 서로 다른 실패 모드를 잡는다.
- 결정적 채점(정확 일치)은 빠르고 싸지만, 정중함·품질처럼 함수로 재기 어려운 주관적 특성은 LLM 심판이 필요하다. 둘을 가중합한 루브릭으로 하나의 보상 신호를 만든다.
- 온라인 평가에서 LLM 심판은 토큰 비용이 크므로 트래픽 규모에 따라 샘플링 전략을 두고, 값싼 함수형 평가는 더 넓게 적용하는 식의 비용 설계가 필요하다.
- 벤치마크가 구현과 분리돼 있다는 점이 강점이다. 같은 벤치마크에 여러 버전의 에이전트를 올려 객관적으로 비교하고, 점수를 개선의 피드백 루프로 쓸 수 있다.
자주 묻는 질문
트레이스, run, thread는 어떻게 다른가요?
트레이스는 에이전트가 한 번 실행될 때의 입력·출력·중간 단계와 메타데이터를 담은 로그입니다. 그 안의 단일 단계가 run이고, 같은 맥락(예: 한 채팅)에서 이어지는 여러 트레이스를 묶은 것이 thread입니다.
결정적 평가와 확률적 평가는 언제 쓰나요?
도구 호출이나 인자처럼 정확히 일치하는지 볼 수 있는 것은 결정적 단언으로 빠르고 싸게 잽니다. 반면 정중함·응답 품질처럼 함수로 재기 어려운 주관적 특성은 LLM을 심판으로 세워 기준 충족 여부를 판단합니다.
벤치마크가 단위·통합·온라인 평가와 다른 점은 무엇인가요?
앞의 세 가지는 특정 내 에이전트의 동작을 평가하지만, 벤치마크는 구현 방식과 분리해 '역량' 자체를 측정합니다. 그래서 서로 다른 에이전트를 같은 잣대로 객관 비교할 수 있습니다. SweBench가 대표적입니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗