AI VIDEO BRIEFING
컨텍스트 로트 논문 분석: 긴 컨텍스트 LLM 성능 저하와 컨텍스트 엔지니어링
Chroma 연구진의 '컨텍스트 로트' 논문은 입력이 길어질수록 LLM 성능이 일관되게 유지되지 않음을 보인다. 방해 문구·유사도·문맥 셔플 실험으로 '무엇을 컨텍스트에 넣는가'가 왜 중요한지 짚는다.

핵심 메시지
쉽게 이해하기
영상은 벡터 데이터베이스·검색 엔진을 만드는 Chroma 연구진의 논문 'Context Rot: How Increasing Input Tokens Impacts LLM Performance'를 분석한다. 발표자는 검색 회사에 유리한 결론이라는 점을 인정하면서도, 코드가 전부 공개돼 재현 가능하고 결과 자체엔 의심의 여지가 없다고 평한다.
출발점은 모델 제공사들이 즐겨 쓰는 '건초더미 속 바늘' 평가다. 긴 텍스트 중간에 사실(바늘)을 하나 심어두고 그에 대한 질문을 던지는 방식인데, 질문과 바늘의 어휘가 거의 그대로 겹쳐 어텐션이 토큰 단위로 손쉽게 매칭한다. 즉 대부분 부분 문자열 매칭만으로 풀리는 쉬운 과제라, 긴 컨텍스트를 잘 다룬다는 인상은 과제가 쉬웠던 탓일 수 있다.
논문은 이 과제를 여러 방식으로 어렵게 만든다. 첫째, 질문-바늘의 임베딩 유사도를 낮추면(정답이 질문과 다른 단어로 표현되면) 컨텍스트가 길어질수록 성능이 훨씬 빠르게 떨어졌다. 둘째, 방해 문구(distractor) — 어휘는 비슷하지만 오답인 문장(예: '대학 교수'가 준 조언 vs 정답인 '대학 동창'이 준 조언) — 를 0·1·4개 넣자 개수가 많을수록 저하 기울기가 가팔라졌고 환각을 유발했다. 실제 코드베이스나 문서엔 이런 방해 문구가 수십 개씩 흔하다.
셋째, 건초더미의 구조를 바꾼 실험이 흥미롭다. 문장 단위로 뒤섞어 문맥이 깨진(비논리적인) 건초더미에서 오히려 성능이 더 높았다. 발표자는 논리적인 텍스트일수록 어텐션이 문맥을 이해하는 데 자원을 쓰거나, 문맥 영향으로 임베딩이 덜 중립적이 되어 질문-바늘 유사도가 낮아지기 때문일 수 있다는 가설을 제시한다.
두 번째 파트는 장기 기억 벤치마크 LongMemEval의 세 하위 과제(지식 갱신, 시간 추론, 다중 세션)를 쓴다. 평균 약 11.3만 토큰에 달하는 전체 대화를 통째로 넣는 조건과, 정답에 필요한 부분만 남긴 '집중' 조건을 비교하자, 과제 난이도는 동일한데도 집중 컨텍스트가 여러 모델 계열에서 크게 앞섰다 — 때로는 통째로 넣을 때의 성능이 절반 수준이었다.
주요 인사이트
- 이 논문의 기여는 '길이'를 '과제 난이도'와 분리해 순수하게 입력만 길게 만들어 성능 변화를 관찰했다는 점에 있다.
- 긴 컨텍스트가 만능이라는 통념에 대한 반례다 — 정보가 창 안에 들어간다고 끝이 아니라, 관련 없는 내용이 많으면 정확도가 무너진다.
- 질문과 정답의 표현이 정확히 겹치면(어휘 유사) 약한 모델도 꽤 긴 컨텍스트까지 잘 버티지만, 방해 문구가 끼는 순간 강한 모델조차 급격히 저하된다.
- RAG 데모가 늘 깔끔해 보이는 이유는 '경비 정책' 같은 어휘 유사도가 극도로 높은 질문을 쓰기 때문이며, 실제 데이터엔 방해 문구가 훨씬 많다는 점을 경계해야 한다.
- 결론적으로 관련 정보를 모델에 넘기기 전에 골라내는 장치(좋은 검색·컨텍스트 구성)가 있으면, 같은 창 크기라도 통째로 넣는 것보다 훨씬 나은 성능을 얻는다.
자주 묻는 질문
'컨텍스트 로트'가 뜻하는 바는?
입력(컨텍스트)이 길어질수록 LLM 성능이 일관되게 유지되지 못하고 점차 저하되는 현상이다. 논문은 여러 모델 계열에서, 과제 난이도를 고정하고 길이만 늘려도 성능이 비균일하게 떨어짐을 보인다.
'건초더미 속 바늘' 평가의 한계는?
질문과 심어둔 사실(바늘)의 어휘가 거의 그대로 겹쳐 어텐션이 손쉽게 토큰 매칭으로 풀 수 있는 쉬운 과제라, 대부분 부분 문자열 매칭만으로 정답이 나온다. 그래서 모델의 실제 긴 컨텍스트 처리 능력을 과대평가하게 만든다.
실무에 주는 시사점은?
창에 다 들어간다고 전부 넣지 말고, 관련 부분만 추려 넣는 컨텍스트 엔지니어링이 중요하다. LongMemEval 실험에서 약 11.3만 토큰 전체를 넣는 것보다 관련 부분만 남긴 집중 컨텍스트가 같은 과제에서 훨씬 높은 성능(때로 약 2배)을 보였다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗