AI VIDEO BRIEFING

CLIP 원리 쉽게 정리 — 이미지·텍스트 임베딩과 대조 학습, 제로샷 분류가 되는 이유

이미지 인코더와 텍스트 인코더를 같은 임베딩 공간에 맞추는 CLIP의 대조 학습 방식과, 학습 때 본 적 없는 데이터도 분류해내는 제로샷 추론의 원리, 그리고 선형 프로브의 쓰임새까지 차근차근 정리했습니다.

이미지와 텍스트를 같은 공간에 놓는다: CLIP이 작동하는 원리 영상 대표 이미지

핵심 메시지

  • CLIP은 이미지 인코더와 텍스트 인코더를 함께 학습시켜 두 종류의 데이터를 같은 임베딩 공간의 벡터로 옮기는 신경망이다.
  • 의미가 맞는 이미지와 텍스트의 벡터는 가깝게, 맞지 않는 쌍은 멀게 만드는 대조 학습으로 훈련한다.
  • 학습에는 인터넷에서 모은 이미지와 자유 형식 텍스트 쌍 약 4억 4천만 개가 쓰였는데, 정답 라벨이 붙은 데이터보다 훨씬 구하기 쉽기 때문이다.
  • 분류할 클래스 이름을 '~의 사진' 같은 자연어 프롬프트로 바꿔 텍스트 인코더에 넣으면, 학습 때 본 적 없는 데이터셋도 분류할 수 있다.
  • 얼어붙은 CLIP 인코더 위에 선형 레이어 하나만 얹어 학습시키는 선형 프로브는 클래스당 학습 예제가 충분할 때 성능을 더 끌어올린다.

쉽게 이해하기

CodeEmporium이 CLIP을 무엇인지, 왜 필요한지, 어떻게 작동하는지 세 갈래로 나눠 설명했습니다. CLIP은 대조적 언어-이미지 사전학습의 약자로, 이미지 인코더와 텍스트 인코더를 동시에 학습시켜 이미지와 텍스트를 같은 임베딩 공간으로 보내는 신경망입니다.

학습 파이프라인은 이렇습니다. 이미지 인코더는 비전 트랜스포머나 ResNet 같은 합성곱 신경망이, 텍스트 인코더는 GPT 계열이 쓰이며 각각 입력을 512차원 벡터로 바꿉니다. 한 배치 안의 이미지 벡터와 텍스트 벡터를 정규화한 뒤 코사인 유사도를 계산하면 N×N 행렬이 나오고, 학습되는 온도 파라미터를 곱해 로짓을 만든 다음 행 방향과 열 방향으로 각각 소프트맥스를 적용합니다. 어떤 이미지가 어떤 텍스트와 짝인지 이미 알고 있으므로 교차 엔트로피 손실로 학습이 가능합니다.

추론 단계에서는 이미지 하나를 벡터로 만들고, 분류하려는 클래스 이름들을 '자동차 사진', '얼룩말 사진' 같은 자연어 문장으로 바꿔 텍스트 인코더에 통과시킵니다. 두 벡터 사이의 유사도를 확률로 바꾸면 분류가 끝납니다. 발표자가 든 예에서는 영양 사진에 97퍼센트의 확률이 매겨졌습니다. 인코더들이 그 분류 데이터셋을 학습 때도 추론 때도 본 적이 없기 때문에 이를 제로샷 추론이라 부릅니다.

왜 이런 방식이 필요할까요. 발표자는 두 가지 이유를 듭니다. 첫째, 이미지마다 정답 라벨을 다는 일은 비용이 큽니다. 방대한 분류 체계로 알려진 ImageNet조차 라벨이 붙은 이미지가 100만 장 수준인 반면, 인터넷에서 긁어모은 자연어 설명이 딸린 이미지는 4억 4천만 장을 쓸 수 있었습니다. 둘째, 자연어로 감독을 주면 이미지 인코더가 이미지의 의미를 더 풍부하게 담은 벡터를 만들게 됩니다.

이를 코드로 확인하는 대목이 흥미롭습니다. 모자를 쓴 자기 사진과 쓰지 않은 사진을 각각 벡터로 만든 뒤 두 벡터의 차이를 구하고, 이를 모자·컵·고양이·보트라는 네 단어의 벡터와 비교했더니 모자가 약 60퍼센트로 가장 높게 나왔습니다. 두 사진의 의미적 차이가 실제로 모자뿐이라는 사실이 벡터에도 그대로 반영된 셈입니다.

주요 인사이트

  • 구하기 어려운 정답 라벨 대신 인터넷에 널려 있는 자연어 설명을 감독 신호로 쓰겠다는 발상 전환이 데이터 규모를 수백 배로 키웠다.
  • 제로샷이 성립하는 이유는 텍스트 인코더가 클래스 이름을 그때그때 벡터로 바꿔줄 수 있기 때문이다. 분류기를 다시 학습시키는 대신 프롬프트만 바꾸면 새 분류 문제가 된다.
  • 임베딩의 차이 벡터가 두 이미지의 의미적 차이와 대응한다는 실험은, 자연어 감독이 벡터에 실제로 의미 구조를 심어 넣는다는 것을 눈으로 보여준다.
  • 제로샷 CLIP은 정답 라벨로 학습된 합성곱·트랜스포머 신경망보다 나은 성능을 보이지만, 클래스당 학습 예제가 많을 때는 선형 프로브 쪽이 유리하다. 상황에 따라 선택이 갈린다.
  • 온도 파라미터까지 학습 대상으로 두어 유사도 분포의 날카로움 자체를 모델이 조정하게 한 점은 대조 학습 설계의 세부지만 결과에 영향을 준다.

자주 묻는 질문

대조 학습이란 무엇인가요?

의미가 서로 대응하는 이미지와 텍스트의 벡터는 최대한 가깝게, 대응하지 않는 것들은 최대한 멀게 만드는 학습 방식입니다. CLIP은 이 방식으로 두 인코더를 동시에 훈련시킵니다.

제로샷 추론이 왜 가능한가요?

이미지 인코더와 텍스트 인코더가 특정 분류 데이터셋으로 학습된 것이 아니기 때문입니다. 분류할 클래스 이름을 자연어 프롬프트로 바꿔 텍스트 인코더에 넣고 이미지 벡터와의 유사도를 비교하면, 학습 때 본 적 없는 데이터셋에서도 분류가 됩니다.

선형 프로브는 무엇을 하는 방법인가요?

학습된 CLIP 인코더의 가중치를 고정한 채 그 위에 선형 레이어 하나를 얹어 그 레이어만 학습시키는 방법입니다. 원래는 CLIP 인코더가 만든 시각 표현의 품질을 평가하려는 용도지만, 예제가 충분하면 전체 성능을 끌어올리는 데도 쓸 수 있습니다.

원문과 출처

이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.

YouTube 원본 영상 보기 ↗

관련 AI 소식