AI VIDEO BRIEFING
CLIP 원리와 제로샷 분류: 버클리 CS 198-126 강의로 이해하는 멀티모달 표현 학습
이미지와 캡션을 같은 잠재 공간에 맞추는 CLIP의 대조 학습 방식, 미세조정 없이 분류가 되는 제로샷 예측의 원리, 그리고 사진으로 배운 모델이 스케치 앞에서 무너지는 분포 변화 문제를 버클리 학부 강의로 정리했다.

핵심 메시지
쉽게 이해하기
버클리 CS 198-126의 이 강의는 멀티모달 학습이 무엇이고 왜 필요한지에서 출발한다. 회색 다람쥐와 붉은 다람쥐라는 두 문장, 그리고 비슷한 자세의 다람쥐 그림 여러 장. 같은 대상을 텍스트로도, 이미지로도, 영상이나 소리로도 나타낼 수 있고, 같은 자료형 안에서도 사진·만화·스케치처럼 결이 다르다.
기존의 자기지도 사전학습은 라벨이나 캡션 같은 부가 정보를 그냥 버리고 라벨 없는 이미지만 남기는 방식이었다. 강의는 이 관행을 문제 삼는다. 이미지-캡션, 영상-오디오처럼 이미 존재하는 짝 관계를 버리는 것은 정보를 버리는 일이고, 클래스 번호만 있어도 '~의 이미지' 같은 캡션을 손쉽게 만들어 붙일 수 있다.
버리지 않아야 하는 더 실용적인 이유는 분포 변화다. ImageNet 같은 사실적 사진으로 학습한 컴퓨터 비전 모델에 손으로 그린 다람쥐 스케치를 주면 성능이 크게 떨어진다. 사람 눈에는 명백히 다람쥐인데도 그렇다. 모든 데이터셋은 가능한 이미지 공간의 좁은 슬라이스일 뿐이고, 그 밖으로 나가는 순간 일반화가 무너진다.
CLIP(Contrastive Language-Image Pre-training)은 이 문제를 데이터 다양성으로 정면 돌파한다. 인터넷에서 모은 방대한 이미지-캡션 쌍을 쓰고, 이미지 인코더와 텍스트 인코더를 처음부터 함께 학습시킨다. 한 배치의 N개 쌍을 각각 인코딩해 내적 행렬을 만든 뒤, 대각선(짝이 맞는 쌍)은 최대화하고 나머지는 최소화하도록 행과 열 양방향으로 교차 엔트로피 손실을 건다.
학습이 끝난 인코더는 미세조정 없이 분류에 쓸 수 있다. 후보 클래스마다 'a photo of a ...' 같은 캡션을 만들어 텍스트 인코더에 통과시키고, 입력 이미지의 임베딩과 내적이 가장 큰 캡션을 답으로 고르는 식이다. 강의는 이 제로샷 방식이 표현 자체가 얼마나 의미 있게 학습됐는지를 보여주는 증거라고 설명한다.
주요 인사이트
- 강의가 강조하는 지점은 CLIP에 새 아키텍처가 없다는 사실이다. 이미지 쪽은 비전 트랜스포머, 텍스트 쪽은 언어용 트랜스포머를 그대로 쓰고, 유일하게 새로운 것은 같은 것을 가깝게, 다른 것을 멀게 밀어내는 손실 설계다.
- 분포 변화에 대한 내성은 수치로 드러난다. ImageNet으로 사전학습한 ResNet-101은 바나나 스케치를 25% 남짓밖에 맞히지 못하는 반면, 미세조정을 전혀 하지 않은 제로샷 CLIP은 60% 수준을 낸다.
- 얼어붙은 CLIP 표현은 그 자체로 쓸모가 있다. 로보틱스에서는 장면 이미지를 새 비전 모델 없이 CLIP 잠재 벡터로 바꿔 의사결정 신경망에 그대로 넣어도 동작한다.
- 3D 쪽 응용은 표현이 얼마나 일반적인지를 극적으로 보여준다. 캡션을 CLIP 텍스트 인코더에 넣어 얻은 벡터와, 뉴럴 래디언스 필드를 렌더링한 이미지의 CLIP 벡터를 맞춰가며 필드를 최적화하면 문장만으로 3차원 물체가 만들어진다. 렌더링 비용 때문에 매우 비싸다는 단서도 함께 붙는다.
- 강의는 CLIP을 멀티모달의 전부가 아니라 출발점으로 자리매김한다. 2021년 논문이고 이후 분야가 크게 변했지만, 멀티모달 표현 학습이라는 흐름이 본격화된 원점이라는 평가다.
자주 묻는 질문
CLIP은 무엇을 학습하나요?
이미지 인코더와 텍스트 인코더가 짝이 맞는 이미지-캡션 쌍에 대해서는 서로 비슷한(내적이 큰) 벡터를 내놓고, 어긋난 쌍에 대해서는 서로 먼 벡터를 내놓도록 함께 학습합니다. 두 인코더는 별개의 모델입니다.
제로샷 분류는 어떻게 이뤄지나요?
후보 클래스마다 'a photo of a 개'처럼 짧은 캡션을 만들어 텍스트 인코더에 넣고, 분류할 이미지의 임베딩과 각 캡션 임베딩의 내적을 비교합니다. 내적이 가장 큰 캡션의 클래스를 답으로 삼으며, 미세조정은 전혀 하지 않습니다.
분포 변화에 얼마나 강한가요?
강의에서 든 예로, ImageNet으로 사전학습한 ResNet-101은 바나나 스케치를 25% 정도만 맞히지만 제로샷 CLIP은 60% 수준을 기록합니다. ImageNet 자체에서도 얼린 ResNet-50 위에 선형 계층을 올린 경우보다 1.9%포인트가량 앞섰습니다.
학습된 CLIP 표현은 분류 외에 어디에 쓰이나요?
모델을 얼린 채 로보틱스의 의사결정 신경망 입력으로 쓸 수 있고, 텍스트-이미지 생성의 바탕이 되며, 캡션과 렌더링 이미지의 임베딩을 맞추는 방식으로 뉴럴 래디언스 필드를 최적화하는 3D 생성에도 쓰입니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗