AI VIDEO BRIEFING

임베딩·대조학습·시맨틱 검색과 RAG까지, 스탠퍼드 CS229 표현학습 강의 핵심 정리

스탠퍼드 CS229 강의가 이미지와 텍스트를 벡터로 바꾸는 임베딩 학습 원리를 설명한다. 라벨 없이 배우는 대조학습, 어려운 음성 쌍 찾기, 벡터 검색과 RAG까지 강의의 핵심 흐름을 차례로 정리했다.

AI는 어떻게 '비슷한 것'을 알아볼까 — 스탠퍼드 CS229가 짚은 임베딩과 검색 영상 대표 이미지

핵심 메시지

  • 임베딩은 이미지나 문장을 벡터로 바꿔 '비슷한 것은 가깝게, 다른 것은 멀게' 배치하는 표현 방식이다.
  • 라벨을 붙인 분류 학습으로도 표현을 얻을 수 있지만, 라벨 확보 비용 때문에 요즘은 라벨 없이 배우는 대조학습이 주류다.
  • 대조학습은 같은 이미지의 두 변형을 가깝게, 서로 다른 이미지를 멀게 만드는 손실 함수로 학습한다.
  • 실전 성능을 가르는 핵심은 '헷갈릴 만큼 비슷하지만 다른' 어려운 음성 쌍(hard negative)을 어떻게 모으느냐다.
  • 이렇게 학습한 임베딩은 벡터 검색에 쓰이고, 그 검색 결과를 LLM 맥락에 넣는 방식이 바로 RAG다.

쉽게 이해하기

스탠퍼드 CS229 강의는 표현학습, 즉 원본 데이터를 벡터로 옮기는 작업에서 출발한다. 이미지든 문장이든 오디오든 하나의 벡터로 매핑하되, 비슷한 대상은 벡터 공간에서 가깝게, 전혀 다른 대상은 멀리 놓이도록 만드는 것이 목표다. 강연자는 이 벡터를 흔히 임베딩이라 부르며, 예전에 쓰이던 '선형 프로브' 같은 활용은 요즘 줄고 유사도 검색이 가장 중요한 쓰임새가 됐다고 말한다.

임베딩을 얻는 첫 번째 방법은 지도학습 사전훈련이다. 수천 개 라벨이 달린 분류 문제를 풀도록 신경망을 학습시킨 뒤, 마지막 분류층을 떼어내고 그 직전 층의 벡터를 표현으로 쓰는 식이다. 다만 라벨이 단순하면 배우는 특징도 빈약해지고, 라벨을 늘리려면 사람이 붙이는 비용이 계속 커진다는 한계가 있다.

그래서 강의의 무게중심은 라벨이 필요 없는 대조학습으로 옮겨간다. 같은 이미지를 무작위로 자르고 뒤집고 흐리게 만들어 두 벌의 변형을 만든 뒤, 두 변형의 임베딩은 가까워지도록 학습한다. 여기에만 집중하면 모든 이미지가 한 점으로 뭉개지므로, 다른 이미지에서 온 쌍은 멀어지도록 반대 방향의 힘을 함께 준다.

강연자는 SimCLR 방식의 손실 함수를 칠판에서 하나씩 풀어 보인다. 배치 안의 이미지들로 유사도 행렬을 만들고, 대각선(같은 이미지의 변형 쌍)은 크게, 나머지 칸은 작게 만들도록 소프트맥스와 로그를 씌운 형태다. 결국 '내 짝이 어느 것인지 맞히는 다중 분류'와 같은 구조이며, 계산 병목은 행렬 계산이 아니라 배치 크기만큼 임베딩을 뽑아내는 순전파라고 짚는다.

마지막 부분은 이 임베딩을 실제로 쓰는 이야기다. 문서 벡터를 미리 계산해 두고 질의 벡터와의 내적이 큰 것을 고르면 시맨틱 검색이 되고, 규모가 커지면 근접 이웃 알고리즘이나 벡터 데이터베이스를 쓴다. 검색으로 고른 문서 몇 개를 LLM의 맥락에 넣어 답을 만들게 하는 것이 RAG이며, 모델을 다시 학습시키지 않아도 되고 권한 관리와 삭제가 쉽다는 점이 장점으로 꼽힌다.

주요 인사이트

  • 대조학습에서 무작위로 고른 두 이미지가 우연히 둘 다 고양이일 수 있고, 그때 손실 함수는 오히려 역효과를 낸다. 강연자는 그런 경우가 드물기 때문에 전체적으로는 이득이 손해를 압도한다고 설명한다.
  • 어려운 음성 쌍을 만들려고 배치를 같은 출처에서 뽑는 실전 요령이 소개된다. 코드 검색이라면 서로 다른 프로그래밍 언어를 섞는 대신 같은 언어, 같은 저장소에서 뽑아야 구분이 어려워지고 학습 신호가 강해진다.
  • 너무 어려운 음성 쌍만 모으면 결국 양성 쌍과 구분되지 않는 지점에 도달한다. 어디서 멈출지 정하는 것이 데이터 필터링의 실질적인 난제다.
  • 텍스트에는 이미지처럼 자르고 뒤집는 증강이 없어서, 문서의 제목·소제목을 한쪽 짝으로, 본문을 다른 쪽 짝으로 삼아 양성 쌍을 만드는 방식이 쓰인다.
  • 강연자는 앤트로픽이 코드 검색에서는 시맨틱 검색 대신 LLM이 만든 정규식 매칭을 쓰는 것으로 알려져 있다고 언급한다. 코드는 구조가 뚜렷해 패턴 검색만으로도 멀리 갈 수 있기 때문이며, 그 외 영역에서는 여전히 의미 기반 검색이 유용하다고 정리한다.

자주 묻는 질문

대조학습에서 '양성 쌍'과 '음성 쌍'은 무엇인가요?

같은 원본 이미지에서 만든 두 변형이 양성 쌍이고, 서로 다른 이미지에서 온 조합이 음성 쌍입니다. 강연자는 음성 쌍이 실제로는 비슷한 대상일 수도 있지만 관행적으로 그렇게 부른다고 설명합니다.

RAG가 파인튜닝보다 나은 점은 무엇인가요?

강의에서는 모델 파라미터를 건드리지 않아 비용이 적고, 사용자별 열람 권한을 검색 단계에서 걸러낼 수 있으며, 문서를 지우면 다시 검색되지 않아 정보 삭제가 쉽다는 점을 꼽습니다. 반대로 파인튜닝한 모델에서 특정 정보만 잊게 만드는 일은 여전히 열린 문제라고 말합니다.

대조학습의 계산 비용에서 진짜 병목은 어디인가요?

배치 크기의 제곱만큼 유사도를 계산하는 부분은 상대적으로 값싸고, 진짜 비용은 배치 안의 모든 샘플에 대해 신경망 순전파로 임베딩을 뽑는 과정이라고 강연자는 답합니다.

원문과 출처

이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.

YouTube 원본 영상 보기 ↗

관련 AI 소식