AI VIDEO BRIEFING

LLM 활용 기술 4가지 — 프리앰블·RAG·추론 모델·AI 에이전트 쉽게 이해하기

루이스 세라노가 대형 언어 모델을 '희미한 전조등과 거대한 백미러를 가진 자동차'에 비유해, 프리앰블·RAG·추론 모델·AI 에이전트라는 네 가지 활용 기술과 역할을 나눈 멀티 에이전트 구조까지 쉽게 풀어 설명한다.

LLM을 제대로 쓰는 네 가지 기술: 프리앰블·RAG·추론 모델·AI 에이전트 영상 대표 이미지

핵심 메시지

  • 언어 모델은 한 번에 한 단어만 내다보는 '희미한 전조등'과, 방대한 지식을 되돌아보는 '거대한 백미러'를 가진 자동차에 비유할 수 있다. 그래서 이해에는 강하지만 계획과 창작에는 약하다.
  • 프리앰블은 모델이 매 답변마다 읽는 지시문으로, 챗봇의 말투와 태도를 손쉽게 다듬는 가장 간단한 기술이다.
  • RAG는 답하기 전에 검색해 근거를 '백미러'에 넣게 하여, 최신 사실이나 모르는 정보를 정확히 답하도록 돕는다.
  • 추론 모델은 답을 내기 전에 초안을 많이 쓰게 하는 방식이며, 모델이 창작자보다 비평가로서 더 뛰어나다는 강점을 활용한다.
  • 에이전트는 두뇌·도구·메모리로 이루어지며, 여러 에이전트를 역할별로 나눈 멀티 에이전트 구조로 긴 글쓰기 같은 복잡한 작업도 처리할 수 있다.

쉽게 이해하기

루이스 세라노는 대형 언어 모델(LLM)을 특이한 자동차에 비유한다. 전조등은 매우 희미해 한 번에 한 단어씩만 앞을 비추므로 여러 단어를 미리 계획하지 못한다. 반면 백미러는 확대·현미경·망원경 기능까지 갖춰 사실상 인류의 모든 지식을 되돌아볼 수 있다. 이 때문에 모델은 이해에는 뛰어나지만 앞을 내다보며 창작하는 일에는 약하다.

첫 번째 기술인 프리앰블은 모델이 매 질문마다 먼저 읽는 지시문이다. '정중한 챗봇처럼 답하고, 후속 질문을 하고, 인사로 마무리하라' 같은 규칙을 넣어두면 인터넷 말투 대신 원하는 태도로 답하게 만들 수 있다. 두 번째인 RAG(검색 증강 생성)는 질문을 검색어로 바꿔 위키피디아 등에서 답을 찾은 뒤 그 내용을 백미러에 넣고 답하게 한다. 2025년 US 오픈 우승자처럼 학습 이후의 사실도 검색 버튼을 누르면 정확히 답하는 이유가 여기에 있다.

세 번째인 추론 모델은 시험에서 곧바로 답을 쓰는 학생보다 초안을 여럿 써보는 학생이 더 잘 푸는 것과 같다. 모델에게 답 전에 여러 생각과 초안을 쓰게 하면, 그 내용을 백미러에 넣고 스스로 비평·수정해 정답을 찾아낸다. 딥시크(DeepSeek)는 여기서 더 나아가 강화학습으로 각 초안의 단계를 채점해 좋은 풀이를 강화했고, 이때부터 모델이 복잡한 수학 문제를 풀기 시작했다.

네 번째인 에이전트는 두뇌(전체를 조율), 도구(함수), 메모리로 구성된다. RAG 자체가 이미 하나의 에이전트다. 계산이 필요한 문제는 '계산기 API를 먼저 호출하라'는 도구를 붙여, 단어 문제를 수식으로 바꾸는 언어 능력(강점)만 쓰고 실제 계산은 계산기에 맡긴다. 라우터 에이전트는 질문이 사실형인지 수학형인지 객관식처럼 분류해 알맞은 에이전트로 넘긴다.

긴 책을 쓰게 하면 3장에서 주인공 이름이 바뀌는 식으로 일관성이 무너진다. 이를 해결하는 것이 창작자·기획자·비평가·집필자로 역할을 나눈 멀티 에이전트 시스템이다. 세라노는 이 구조가 객체지향 프로그래밍과 닮았지만, LLM이 미리 정의되지 않은 오류까지 판단해 대응하고 필요하면 새 에이전트를 만들 수 있다는 점에서 더 나아간다고 설명한다. 완전 정적인 프로그램과 완전 동적인 인간 팀 사이에서, 에이전트는 자율성을 인간 쪽으로 끌어올리는 것을 목표로 한다.

주요 인사이트

  • 네 가지 기술의 공통 원리는 '한 단어씩 내다보는 전조등' 대신 '되돌아보는 백미러'를 쓰게 해, 모델의 약점을 피하고 강점을 활용하는 것이다.
  • RAG의 어려운 부분은 정보를 찾는 것이지 질문을 검색어로 바꾸는 것이 아니다. 검색어 변환은 언어 모델이 잘하는 일이고, 찾은 근거를 맥락에 넣어 답하는 마지막 단계에서 실수 여지가 크게 줄어든다.
  • 모델은 만드는 것보다 평가하는 데 강하다. 추론 모델과 멀티 에이전트의 비평가 역할은 모두 이 '비평가로서의 강점'에 기댄다.
  • 새 기능을 기존 에이전트에 추가할지 새 에이전트를 만들지의 판단은, 사람 팀에서 기존 직원에게 역할을 더 줄지 새 사람을 뽑을지 결정하는 것과 같다.
  • 에이전트가 객체지향 워크플로와 다른 점은, 예측하지 못한 오류가 나도 LLM의 판단력으로 스스로 고치도록 요청하며 대응할 수 있다는 데 있다.

자주 묻는 질문

프리앰블이란 무엇인가?

모델이 매 질문에 답하기 전에 항상 먼저 읽는 지시문이다. 말투나 태도, 지켜야 할 규칙을 담아두면 모델이 그 지침에 맞춰 답하게 되며, 챗봇을 만들 때 특히 유용한 가장 간단한 기술이다.

추론 모델은 왜 초안을 많이 쓰게 하는가?

언어 모델은 다음 단어를 고르는 데 특화돼 있어 곧바로 정답을 내기 어렵다. 대신 여러 초안을 쓰게 한 뒤 그 내용을 되돌아보며 비평·수정하면, 모델이 잘하는 '비평' 능력으로 정답을 찾아낼 수 있다.

RAG는 에이전트와 어떤 관계인가?

RAG 자체가 하나의 에이전트다. 전체를 조율하는 두뇌, 질문을 검색어로 바꾸고 검색해 답하는 도구(함수), 원래 질문과 검색 결과를 담는 메모리라는 에이전트의 세 요소를 모두 갖추고 있다.

멀티 에이전트 시스템은 단순한 객체지향 프로그래밍과 무엇이 다른가?

구조는 닮았지만, 각 에이전트가 LLM이라 미리 정의되지 않은 오류도 판단해 대응할 수 있다. 잘못된 입력을 알아서 고쳐달라고 요청하거나 필요하면 새 에이전트를 추가하는 등, 정적인 프로그램보다 더 자율적으로 동작한다.

원문과 출처

이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.

YouTube 원본 영상 보기 ↗

관련 AI 소식