AI VIDEO BRIEFING
복잡하고 서로 모순된 문서·벡터 데이터베이스에서 RAG가 실패하는 이유와 실무 해결책 3가지
IBM Technology가 서로 모순되는 문서들이 섞인 환경에서 RAG가 왜 틀린 답을 내는지 설명하고, 문서 관리·질문 명확화·데이터 이해라는 세 가지 실무 해법으로 신뢰할 만한 답을 얻는 방법을 제시한다.

핵심 메시지
쉽게 이해하기
영상은 사람과 언어가 본래 복잡하다는 점에서 출발한다. 뉘앙스와 미묘한 차이로 가득한 문서를 AI가 그대로 담아내기 어렵기 때문에, 복잡한 문서에 기반한 RAG는 혼란스럽거나 틀린 답을 내놓기 쉽다.
대표 예시로 '2020년 미국 대학 미식축구 챔피언은 누구인가'를 든다. 시즌은 보통 8월부터 12월까지지만 챔피언 결정전은 이듬해 1월에 열려, 같은 팀이 상황에 따라 2019년 챔피언으로도 2020년 챔피언으로도 불린다. 질문자의 의도에 따라 정답이 달라지는 셈이다. 현실의 문서 모음도 마찬가지여서, 1990년대에 쓰인 규정과 2020년대 규정이 서로 충돌하기도 한다.
기본 RAG 구조는 단순하다. 사용자의 질문이 벡터 데이터베이스로 가서 검색 결과를 얻고, 그 결과와 원래 질문을 함께 LLM에 넘겨 답을 만들어 사용자에게 돌려준다. 문제는 문서 집합이 복잡할 때 이 구조를 어떻게 보강하느냐다.
첫째, '불필요한 실수'를 없애야 한다. 2019년 정책과 이를 대체한 2024년 정책이 데이터베이스에 함께 들어 있으면 RAG가 혼동한다. 좋은 문서 관리로 있어선 안 될 문서를 미리 제거해야 한다. 둘째, 명확화 루프를 둔다. '바나나는 왜'처럼 말이 안 되는 질문이나 '2010년 챔피언은?'처럼 범위가 모호한 질문은 사용자에게 다시 물어 구체화하게 만든다.
셋째이자 핵심은 'AI ≤ 데이터'다. 사람이 문서를 다 읽었을 때 답이 X, Y, Z 여러 개라면, AI도 하나로 단정하지 말고 '여러 가능성이 있다'고 답할 만큼 견고해야 한다. 특히 법·정책·의견은 사실처럼 제시하지 말고 해석의 맥락과 함께 내놓아야 한다. 데이터의 성격을 먼저 이해하고 설계하는 것이 핵심이며, 그러지 않아 생긴 오답을 환각이라 부르는 것은 사실 설계의 문제다.
주요 인사이트
- RAG 품질은 검색·모델 성능보다 '데이터베이스에 무엇이 들어 있는가'에 크게 좌우된다. 낡거나 대체된 문서를 걸러내는 관리가 선행돼야 한다.
- 한 질문에 정답이 여럿일 수 있음을 인정하는 것이 오히려 신뢰를 높인다. 하나로 단정한 답은 문서 현실과 어긋나기 쉽다.
- 명확화 루프는 사용자의 질문 의도를 좁혀 주어, 검색·생성 단계 이전에 오답의 소지를 줄인다.
- 의견을 사실처럼 출력하도록 설계된 시스템의 오답은 모델의 환각이라기보다 설계 결함이다.
자주 묻는 질문
왜 같은 질문에 정답이 여러 개일 수 있나?
문서 모음은 여러 사람이 오랜 기간에 걸쳐 만든 것이라 서로 모순되는 내용이 섞이기 때문이다. 미식축구 챔피언 예처럼 시점·의도에 따라 같은 사실이 다르게 표현되기도 하고, 옛 규정과 새 규정이 충돌하기도 한다.
복잡한 문서에 대한 RAG를 어떻게 보강하나?
첫째, 대체됐거나 있어선 안 될 문서를 벡터 데이터베이스에서 제거하는 문서 관리를 한다. 둘째, 모호하거나 부적절한 질문을 되물어 구체화하는 명확화 루프를 둔다. 셋째, 답이 여럿이면 단정하지 않고 여러 가능성을 제시하도록 설계한다.
'AI는 데이터보다 크지 않아야 한다'는 말은 무슨 뜻인가?
문서를 근거로 낼 수 있는 답의 범위를 넘어서 AI가 임의로 하나의 답을 단정해서는 안 된다는 뜻이다. 문서상 답이 여러 개면 그대로 여러 가능성을 제시하고, 의견은 사실이 아니라 해석의 맥락과 함께 제시해야 한다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗