AI VIDEO BRIEFING

토큰·컨텍스트 윈도우·RAG란? LLM 개발 기본 개념 쉽게 이해하기

구글 클라우드 개발자들이 토큰, 생성형 AI, RAG, 컨텍스트 윈도우, 토큰 맥싱 같은 LLM 핵심 용어를 대화로 풀어 설명한다. AI로 코딩하기 전 알아둘 기본기를 정리했다.

토큰·컨텍스트 윈도우·RAG: LLM으로 개발하기 전에 알아야 할 기본 개념 영상 대표 이미지

핵심 메시지

  • 토큰은 LLM이 입력·출력을 다루는 기본 단위로, 단어도 문장도 아닌 그 중간쯤이며 평균적으로 한 토큰이 단어의 약 4분의 3에 해당한다.
  • 생성형 AI는 질문을 토큰 열로 쪼갠 뒤 학습 데이터와 주어진 맥락을 바탕으로 다음 토큰을 예측하는 "고급 자동완성"에 가깝고, 같은 질문에도 매번 조금씩 다른 답을 내는 비결정적 특성이 있다.
  • RAG(검색 증강 생성)는 학습 데이터의 시점 한계를 메우기 위해, 외부에서 검색해 온 추가 데이터로 LLM의 답변을 보강하는 기법이다.
  • 컨텍스트 윈도우는 모델이 한 번에 다룰 수 있는 토큰의 양이며, 이 한계를 넘으면 대화를 압축(compact)해 핵심만 다음 대화로 넘긴다.
  • 토큰을 무작정 많이 쓰는 "토큰 맥싱"이 늘 생산성을 높이는 것은 아니며, 추론 비용이 사용자에게 잘 드러나지 않는 구조 탓에 과소비가 발생하기 쉽다.

쉽게 이해하기

AI로 코딩하고 서비스를 만드는 사람이 늘면서 토큰, 컨텍스트 윈도우, RAG 같은 용어가 일상어가 됐지만 정확한 의미를 모른 채 쓰는 경우가 많다. 구글 클라우드 개발자들은 이 기본 개념들을 짧은 대화 형식으로 짚었다.

토큰은 대규모 언어모델(LLM)이 다루는 최소 단위다. 단어 하나가 곧 토큰 하나는 아니고, 평균적으로 한 토큰이 단어의 4분의 3 정도다. 모델은 입력받은 토큰 패턴을 보고 그다음에 올 토큰을 확률적으로 이어 붙이는 방식으로 답을 만든다. 발표자들은 이를 "고급 자동완성"이라 표현했다.

이 때문에 생성형 AI의 답은 매번 똑같지 않다. 같은 질문을 던져도 조금씩 다른 결과가 나오는 것은 모델이 본질적으로 비결정적이기 때문이다. 답변은 학습 데이터와, 사용자가 준 맥락으로부터 추론된 결과다.

모델은 특정 시점까지의 데이터로 학습되고, 그 시점 이후의 정보는 알지 못한다. 학습이 끝난 지 한참 뒤에 실제 서비스에 투입되기도 한다. 이 간극을 메우는 방법이 RAG, 즉 검색해 온 추가 데이터로 답변을 보강하는 것이다.

컨텍스트 윈도우는 모델이 한 번에 처리할 수 있는 토큰의 총량이다. 최근 몇 년 새 이 크기가 크게 늘면서 도구의 활용 폭도 넓어졌다. 대화가 길어져 한계를 넘으면 에이전트가 대화를 압축해 가장 관련 있는 부분만 새 대화로 넘긴다. 한편 토큰을 최대한 많이 쓰는 "토큰 맥싱"에 대해서는, 비용이 사용자에게 잘 보이지 않는 탓에 나온 현상일 뿐 반드시 더 생산적인 것은 아니라는 신중한 시각을 내놓았다.

주요 인사이트

  • LLM의 동작을 "확률적으로 다음 토큰을 잇는 자동완성"으로 이해하면, 답이 매번 달라지는 비결정성과 환각 같은 현상을 자연스럽게 받아들일 수 있다.
  • RAG는 모델을 다시 학습시키지 않고도 최신·전용 데이터를 답변에 반영하는 현실적인 방법이라, 학습 시점 이후의 정보나 사내 데이터가 필요한 서비스에서 특히 유용하다.
  • 컨텍스트 윈도우가 커졌다고 무조건 토큰을 많이 넣는 것이 이득은 아니며, 추론 비용의 실체가 드러날수록 어떤 작업에 토큰을 쓸 가치가 있는지 분별하는 감각이 중요해진다.

자주 묻는 질문

토큰은 단어와 같은 개념인가요?

아닙니다. 토큰은 단어도 문장도 아닌 그 중간쯤의 단위로, 평균적으로 한 토큰이 단어의 약 4분의 3에 해당하며 토큰마다 크기가 일정하지도 않습니다.

RAG(검색 증강 생성)는 무엇을 해결하나요?

모델의 학습 데이터에는 시점 한계가 있어 최신 정보나 특정 데이터를 알지 못합니다. RAG는 외부에서 검색해 온 데이터로 LLM의 답변을 보강해 이 한계를 메웁니다.

대화 중 에이전트가 대화를 "압축한다"는 것은 무슨 뜻인가요?

대화가 길어져 컨텍스트 윈도우(한 번에 다룰 수 있는 토큰 한계)를 넘으면, 대화를 가장 관련 있는 핵심만 남겨 압축한 뒤 새 대화로 이어가는 것을 뜻합니다.

원문과 출처

이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.

YouTube 원본 영상 보기 ↗

관련 AI 소식