AI VIDEO BRIEFING
GRAG 논문 리뷰: 그래프 검색 증강 생성이 기존 RAG의 맥락 소실과 환각을 줄이는 원리
에모리대 연구진이 내놓은 GRAG는 텍스트 조각만 긁어오는 기존 RAG의 한계를 지적한다. 부분 그래프 추출과 부드러운 가지치기, 텍스트·그래프 이중 입력으로 환각을 줄인 원리와 실험 수치를 알기 쉽게 정리했다.

핵심 메시지
쉽게 이해하기
영상은 하나의 가정에서 출발한다. 최신 의학 논문을 모두 학습한 AI가 어떤 희귀병의 치료법으로 특정 신약을 자신 있게 추천하고, 근거로 수십 편의 논문을 제시한다. 그런데 그 수십 편이 사실은 단 하나의 초기 임상 연구를 인용하고 있었고, 그 연구가 데이터 조작으로 철회됐다면 답변 전체가 무너진다. AI는 텍스트 조각은 읽었지만 조각들을 잇는 인용이라는 보이지 않는 선을 보지 못한 것이다.
기존 RAG의 한계가 여기 있다. 벡터 데이터베이스에 기대는 검색은 질문과 의미가 가까운 문서 조각을 각각 독립적으로 찾아올 뿐이어서, 고도화된 키워드 매칭에 가깝다. 태양 플레어 예측 모델의 동향을 알고 싶은 연구자에게 필요한 것은 관련 단어가 들어간 논문 더미가 아니라, 어떤 방법론이 어떤 선행 연구의 한계를 넘으려 등장했고 거기서 무엇이 파생됐는지 보여주는 인용 그래프의 구조다. 발표자는 이를 위키백과의 파란 하이퍼링크를 한 번도 누르지 않고 개별 문서만 읽는 상황에 비유한다.
그렇다면 지식 그래프 전체를 모델에 넘기면 되지 않느냐는 질문이 나오지만, 이는 계산상 불가능하다. 거대한 텍스트 그래프에서 질문에 맞는 부분 그래프를 한 번에 뽑아내는 것은 전형적인 NP-난해 문제이고, 노드와 연결선의 조합은 기하급수적으로 늘어난다. 에모리대 연구진은 대신 질문과 의미적으로 가까운 중심 노드 몇 개를 먼저 찾고, 그 주변 1~2단계 거리의 이웃만 묶은 k-홉 에고 그래프를 여러 개 추출해 하나로 병합하는 방식을 택했다.
문제는 이웃을 기계적으로 끌어오면 노이즈가 폭발한다는 점이다. 태양 플레어 논문이 인용한 통계학 논문이 우연히 주식시장 분석 논문을 인용했다면 엉뚱한 정보가 함께 들어온다. GRAG는 질문 벡터와 에고 그래프의 노드·연결선을 다층 퍼셉트론에 통과시켜 관련성 점수를 계산하고, 기준치보다 낮은 요소의 스칼라 값을 0에 가깝게 눌러버린다. 그래프 구조 자체를 끊는 것이 아니라 불필요한 잔가지의 신호 강도만 낮추는 적응적 마스킹이다.
정제된 지도를 어떻게 텍스트만 읽는 언어 모델에 넣느냐가 다음 과제다. 연구진은 두 가지를 동시에 준다. 하나는 너비 우선 탐색으로 노드를 훑은 뒤 들여쓰기로 부모-자식 관계를 표현한 계층형 텍스트로, 코드와 JSON을 대량으로 학습한 최신 모델이 위상 구조를 바로 알아채도록 만든 하드 프롬프트다. 다른 하나는 그래프 신경망 인코더가 그래프의 모양과 연결 강도를 압축한 벡터를 입력층에 직접 꽂는 소프트 프롬프트다.
주요 인사이트
- 절제 실험이 두 입력의 역할을 분명히 보여준다. 지식 그래프 질의응답 데이터셋에서 둘 다 쓴 전체 모델은 정답률 0.72였는데, 벡터로 넣는 그래프 뷰를 빼면 0.58로 떨어지고 텍스트 뷰를 가리면 0.44까지 반토막이 났다. 뼈대와 살이 함께 있어야 복잡한 지식망이 하나의 맥락으로 소화된다는 뜻이다.
- 가장 도발적인 결과는 파인튜닝과의 비교다. 파인튜닝을 전혀 하지 않은 동결 모델에 GRAG 프롬프트만 붙인 쪽이 같은 데이터로 무겁게 파인튜닝한 모델보다 높은 추론 성능을 냈다. 도메인 지식을 가중치에 새겨 넣는 대신 좋은 지도를 프롬프트로 얹는 것이 더 나을 수 있다는 신호다.
- 모델 크기의 역설도 함께 제시된다. 외부 검색 없이 단독 추론만 시켰을 때 라마2 70억 파라미터 모델이 33.9%, 두 배 크기인 130억 모델이 33.5%로 사실상 차이가 없었다. 외부 지식의 맥락이 주어지지 않으면 모델을 키워도 추론은 제자리라는 것이다.
- 환각 억제 효과는 사람이 직접 검증한 평가로 측정했다. 기존 텍스트 검색기를 쓴 답변에서 실제 지식 그래프에 존재하는 타당한 정보의 비율이 62~71%에 그쳤는데, GRAG를 적용하자 79%로 올랐다. 의료·법률·금융처럼 30% 오답이 곧 사용 불가를 뜻하는 영역에서는 의미가 큰 차이다.
- 범용성도 확인됐다. 큰 데이터셋에서 학습한 그래프 인코더 가중치를 성격이 전혀 다른 작은 데이터셋에 그대로 적용하자 기본 모델 대비 33%의 성능 향상이 나타났다. 한 분야에서 점과 선을 읽는 구조적 독해력을 갖추면 낯선 분야에서도 그 방법을 재사용할 수 있다는 의미다.
자주 묻는 질문
GRAG가 기존 RAG와 근본적으로 다른 점은 무엇인가?
기존 RAG는 질문과 의미가 비슷한 텍스트 조각을 각각 독립적으로 가져온다. GRAG는 조각들을 잇는 연결 구조까지 부분 그래프 형태로 가져와, 어떤 연구가 어떤 연구의 한계를 넘으려 등장했는지 같은 맥락을 함께 전달한다.
'부드러운 가지치기'는 어떤 방식인가?
질문 벡터와 후보 그래프의 노드·연결선을 다층 퍼셉트론에 통과시켜 관련성 점수를 산출한 뒤, 기준치보다 낮은 요소의 스칼라 값을 0에 가깝게 억제한다. 그래프 구조를 물리적으로 끊지 않고 불필요한 부분의 신호 강도만 낮추는 적응적 마스킹이다.
텍스트 뷰와 그래프 뷰 중 하나만 써도 되나?
절제 실험 결과 둘 다 쓴 모델의 정답률이 0.72였는데, 그래프 뷰를 제거하면 0.58, 텍스트 뷰를 제거하면 0.44로 떨어졌다. 둘 중 어느 쪽도 나머지를 대체하지 못한다.
환각은 실제로 얼마나 줄었나?
사람이 직접 검증한 평가에서 기존 텍스트 검색기 기반 답변의 타당한 정보 참조 비율이 62~71%였던 반면, GRAG를 적용하자 79%로 올랐다. 완벽하지는 않지만 존재하지 않는 연결을 지어내는 오류가 크게 줄었다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗