AI VIDEO BRIEFING

AI 평가(Evals) 실전 정리: 관측가능성과 세 가지 지표로 에이전트 신뢰성 확보하기

실제 빅테크 기술 면접 질문을 모의 면접으로 재현한 영상이다. AI 에이전트의 신뢰성을 관측가능성과 평가로 나누고, 답변 관련성과 근거성, 도구 호출 순서 정확도라는 세 지표의 계산 방법을 설명한다.

AI 에이전트의 신뢰성은 어떻게 검증하나 — 모의 면접으로 본 평가 설계 영상 대표 이미지

핵심 메시지

  • AI 애플리케이션의 신뢰성은 관측가능성과 평가라는 두 축의 합으로 정리된다.
  • 에이전트에서 기록해야 할 대상은 기존 로그가 아니라 시스템 프롬프트 변화, 호출된 도구와 그 응답, 그에 따른 판단을 담은 에이전트 트레이스다.
  • 평가의 핵심 지표는 답변 관련성, 근거성, 도구 호출 순서 정확도 세 가지다.
  • 정답이 주어지지 않는 경우가 대부분이므로 합성 데이터셋을 만들거나 도메인 전문가와 함께 골든 데이터셋을 구성해야 한다.
  • 품질보증팀이 따로 있던 시절과 달리, 평가는 애플리케이션을 만드는 엔지니어가 직접 수행해야 한다.

쉽게 이해하기

가우라브 센 채널의 AI 면접 질문 시리즈 네 번째 편은 실제 빅테크 기술 면접에서 나온 질문을 모의 면접 형식으로 재현한다. 설정은 의료 서비스 회사다. 환자가 앱에서 진단 정보를 확인하고 의사와 연결되는 구조이기 때문에, 회사는 신뢰할 수 있는 정보만 제공해야 하고 실수가 곧 소송으로 이어질 수 있다. 면접관은 이 조건에서 비용을 줄이고 업무를 자동화하되 신뢰성을 지키는 방법을 묻는다.

지원자의 출발점은 명확하다. AI는 비결정적이지만 그럼에도 신뢰성을 확보하는 방법이 있고, 그것은 관측가능성과 평가라는 두 요소로 정리된다는 것이다. 관측가능성은 오래전부터 해오던 일이지만 관측 대상이 달라졌다. 에이전트에는 시스템 프롬프트와 도구가 있고, 특정 질의에 대해 어떤 도구가 몇 번 호출됐는지, 그 응답이 무엇이었는지, LLM이 그 응답을 근거로 어떤 판단을 내렸는지를 저장해야 한다. 이 기록을 에이전트 트레이스라고 부르며, 이것이 없으면 애초에 평가할 재료가 없다.

평가는 AI 에이전트를 위한 품질보증에 해당한다. 프롬프트가 새어 나가지는 않는지, 도구 호출 과정에서 개인정보가 노출되지는 않는지, 같은 정보를 받고도 특정 도구를 반복 호출하지는 않는지 같은 항목을 점검한다. 지원자는 이를 세 가지 지표로 압축한다. 답변 관련성은 사용자가 물은 것에 실제로 답하고 있는지를, 근거성은 주어진 맥락에 기대어 답하고 있는지 곧 환각이 섞이지 않았는지를, 도구 호출 순서 정확도는 정해진 순서를 지키는지를 본다.

각 지표를 계산하는 데 필요한 재료도 구체적으로 나온다. 답변 관련성은 사용자 질의와 응답, 필요하면 시스템 프롬프트까지 있으면 되고, 근거성은 여기에 맥락이 하나 더 필요하다. RAG에서는 검색으로 가져온 상위 청크가, 에이전트에서는 도구 호출 응답이 그 맥락이 된다. 항공권 예약 에이전트를 예로 들면 사용자 정보 조회, 항공편 검색, 결제라는 도구가 있을 때 사용자 정보를 가져오지 않고 곧바로 검색으로 넘어가는 것이 순서 문제에 해당한다.

평가를 누가 하느냐는 질문에는 조직 구조의 변화가 답으로 나온다. 과거에는 품질보증팀이 별도로 있었지만, 여기서는 애플리케이션을 만드는 엔지니어가 직접 평가해야 하며 다른 사람이 맡는다면 시스템 내부에서 무슨 일이 벌어지고 무엇이 기록되는지 제대로 인수인계를 받아야 한다는 것이다. 단위 테스트와 달리 정답이 미리 주어지지 않는 경우가 많다는 점도 지적된다.

주요 인사이트

  • 신뢰성을 관측가능성과 평가의 합으로 두는 구성은 순서를 분명히 한다. 무엇을 저장할지 정하지 않으면 평가할 대상 자체가 존재하지 않기 때문에, 트레이스 설계가 지표 설계보다 앞선다.
  • 근거성 계산에 필요한 맥락이 RAG에서는 검색 청크, 에이전트에서는 도구 응답으로 대응된다는 정리는 두 아키텍처의 평가를 같은 틀로 다룰 수 있게 해준다.
  • 지원자는 도구 호출 순서 지표를 정확도라고 느슨하게 적었지만 실제로는 재현율과 정밀도를 비롯한 지표를 함께 써야 한다고 스스로 정정한다.
  • 정답 데이터가 없는 상황에서 도메인 전문가와 마주 앉아 골든 데이터셋을 만드는 과정이 가장 중요한 단계로 지목된다는 점은, 평가가 코드 작업이 아니라 도메인 작업임을 보여준다.
  • 영상 말미의 농담처럼, 도구 호출과 평가 설계는 모델 자체의 한계를 없애주지 않는다. 신뢰성 확보와 모델 능력의 한계는 별개의 문제다.

자주 묻는 질문

에이전트 트레이스에는 무엇을 저장하나?

시스템 프롬프트의 변화, 호출한 도구와 그 응답, 특정 질의에 대해 도구가 몇 번 호출됐는지, 그리고 LLM이 도구 응답을 근거로 내린 판단이 포함된다. 기존 소프트웨어에서 로그를 남기던 것과 목적은 같지만 관측 대상이 에이전트의 구성 요소로 바뀐 것이다.

근거성(groundedness)은 무엇을 재는 지표인가?

에이전트가 주어진 맥락에 기대어 답하고 있는지를 보는 지표로, 사실상 환각 여부를 계산하는 것으로 이해할 수 있다. 근거성이 높다는 것은 에이전트가 맥락과 도구 호출 응답을 제대로 따르고 있다는 뜻이다.

정답 데이터가 없을 때는 어떻게 평가하나?

특정 패턴을 따라 합성 데이터셋을 생성하거나, 도메인 전문가와 함께 골든 데이터셋을 만들어 그 위에서 에이전트를 평가한다. 기법으로는 LLM을 심판으로 쓰는 방식이 언급되며, 수치 데이터가 충분하면 정량 평가도 함께 수행한다.

원문과 출처

이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.

YouTube 원본 영상 보기 ↗

관련 AI 소식