AI VIDEO BRIEFING

AI 에이전트 평가의 미래: LLM 심판을 넘어 에이전트로 에이전트를 평가하는 전략

아리즈 공동창업자가 매달 1억 건 평가 경험을 바탕으로, 고정된 LLM 심판을 넘어 에이전트로 에이전트를 평가하는 '에이전트 심판'이 왜 AI 평가의 다음 단계인지 자사 에이전트 사례를 들어 설명한다.

'LLM 심판'을 넘어 '에이전트 심판'으로: AI 평가가 향하는 다음 단계 영상 대표 이미지

핵심 메시지

  • 평가(Eval)는 이제 모든 진지한 AI 팀이 승부를 거는 핵심 역량이 됐다.
  • 아리즈(Arize)는 매달 1억 건 넘는 평가를 돌리며, 상위 팀은 3,800개 이상의 평가기를 운영한다.
  • 에이전트가 복잡해지면서 실패 방식도 달라져, 고정된 채점 기준의 'LLM 심판'만으로는 놓치는 오류가 생긴다.
  • 해법은 '에이전트로 에이전트를 평가하는' 방식으로, 매번 달라지는 실행 경로를 적응적으로 분석한다.
  • 결정론적 평가·LLM 심판·에이전트 심판을 함께 쓰는 것이 평가의 미래다.

쉽게 이해하기

AI 엔지니어 컨퍼런스의 평가 트랙에서 아리즈(Arize) 공동창업자 아파르나가 발표에 나섰다. 그는 평가가 'PM과 AI 엔지니어가 새로 배워야 할 기술'에서 '모든 진지한 AI 팀이 베팅하는 것'으로 위상이 올라갔다고 짚었다. 아리즈는 매달 1억 건이 넘는 평가를 돌리고, 평균 팀은 약 12개의 평가 잡을, 상위 팀은 3,800개 이상의 평가기를 운영한다고 한다.

그는 특히 실서비스 트레이스(실행 기록)에 대한 온라인 평가에 주목한다. 무엇이 잘 작동하고 어디서 실패하는지 파악하고, 지속 학습 루프를 돌리는 데이터의 원천이 되기 때문이다. 문제는 평가의 대상 자체가 발밑에서 바뀌었다는 점이다. 2023년엔 프롬프트에 답하는 일이었지만, 2024년엔 도구 호출·추론·딥리서치가 더해졌고, 지금은 실데이터 위에서 루프를 돌며 서브에이전트를 띄우고 장기 과제를 수행한다.

아리즈는 자사 UI에 사는 에이전트 'Alex'로 이 고통을 직접 겪었다. 프런티어 모델 기능이 추가될 때마다 Alex에도 반영해 더 긴 기억, 동적 UI 생성, 방대한 트레이스 검색이 가능해졌다. 하지만 맥락을 잊거나, 작업이 끝났는지 모르거나, 루프에 갇히는 실패도 함께 나타났다. 매 상호작용마다 새 UI를 만들어내는 비결정론적 궤적은, 고정된 루브릭을 쓰는 고전적 'LLM 심판'으로는 잡아내기 어려웠다.

여기서 큰 깨달음이 나왔다. 에이전트를 평가하는 최선의 방법이 또 다른 에이전트라는 것이다. 이는 결정론적 평가나 LLM 심판을 폐기한다는 뜻이 아니라, 다른 유형의 문제에는 다른 도구가 필요하다는 의미다. LLM 심판이 고정된 루브릭과 점수를 준다면, '에이전트 심판'은 적응적이고 동적인 분석을 한다. 대부분의 팀은 앞의 두 가지만 하고 있지만, 평가의 미래는 세 가지를 모두 갖추는 것이라고 그는 말한다.

아리즈는 '에이전트 심판'을 구현한 제품 'Signal'을 공개했다. Signal은 들어온 트레이스를 읽어 문제 패턴을 발견하는 장기 실행 에이전트로, 같은 도구를 여러 번 반복 호출하거나 궤적이 비효율적인 것처럼 고정 루브릭으론 떠올리기조차 어려운 미묘한 실패를 찾아낸다. 나아가 분석 결과를 바탕으로 수정 PR까지 올린다. 앤트로픽·오픈AI의 CPO들과 개리 탄 같은 업계 인사도 '평가가 전부'라는 데 뜻을 같이한다.

주요 인사이트

  • 실서비스 트레이스에 대한 온라인 평가가 실패를 잡아내고 지속 학습 루프를 돌리는 데이터 원천이 된다.
  • 시스템이 복잡해질수록 실패는 '틀린 답'이 아니라 비효율적 궤적·무한 루프·완료 인지 실패처럼 과정의 문제로 옮겨간다.
  • 매번 실행 경로가 달라지는 에이전트에는 고정된 채점표가 근본적으로 맞지 않는다.
  • 에이전트 심판은 기존 평가를 대체하는 것이 아니라, 결정론적 평가·LLM 심판·에이전트 심판을 함께 쓰는 조합으로 나아간다.

자주 묻는 질문

아리즈는 얼마나 많은 평가를 돌리나?

매달 1억 건 이상을 돌리며, 평균 팀은 약 12개의 평가 잡을, 상위 팀은 3,800개 이상의 평가기를 운영한다.

'LLM 심판'의 한계는 무엇인가?

고정된 루브릭과 점수를 주기 때문에, 매 상호작용마다 궤적이 달라지는 에이전트의 실패(같은 도구 반복 호출, 비효율 경로 등)를 잡기 어렵다.

'에이전트 심판(Signal)'은 무엇을 하나?

트레이스를 읽어 문제 패턴을 발견하고 미묘한 실패를 찾아내며, 수정 PR까지 제안하는 장기 실행 에이전트다.

원문과 출처

이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.

YouTube 원본 영상 보기 ↗

관련 AI 소식