AI VIDEO BRIEFING
코넬 CS 6785 GAN 심화 정리: f-다이버전스, BiGAN, 사이클GAN과 학습 불안정성
코넬대 심층 생성 모델 강의가 GAN의 불안정성과 확장을 다룬다. 기울기 소실과 모드 붕괴가 왜 생기는지, f-다이버전스로 목적함수를 넓히는 f-GAN과 잠재변수 추론용 BiGAN, 짝 없는 도메인 변환을 푸는 사이클GAN을 정리했다.

핵심 메시지
쉽게 이해하기
코넬대 심층 생성 모델 강의의 GAN 두 번째 시간으로, 앞선 강의 내용을 복습한 뒤 세 가지 심화 주제로 넘어간다. 강의는 GAN을 생성기와 판별기 두 신경망 사이의 게임으로 정리하며 출발하는데, 생성기는 가우시안 같은 단순한 입력 공간의 샘플을 이미지나 오디오 같은 출력 공간의 샘플로 바꾼다. 분포의 평균과 분산을 내놓는 변분 오토인코더와 달리 샘플을 곧바로 뱉기 때문에 확률식을 지정할 필요가 없고 표현력이 넓어진다. 대신 로그 가능도 공식이 없어 늘 쓰던 최대가능도 목적함수를 그대로 쓸 수 없다.
그래서 학습은 두 표본이 같은 분포에서 나왔는지 판정하는 두 표본 검정을 최소화하는 방식으로 이뤄진다. GAN은 검정에 쓸 통계량을 고정하는 대신 판별기라는 이름으로 함께 학습하는데, 실제 데이터와 생성 데이터 양쪽에서 표본을 얼마든지 만들 수 있으므로 이런 학습이 가능하다. 결과적으로 목적함수는 한쪽이 최대화하고 다른 쪽이 최소화하는 미니맥스 게임이 되고, 학습은 훨씬 까다로워진다.
강의는 대표적 실패 양상을 짚는다. 학습 초기처럼 판별기가 가짜를 너무 잘 골라내면 해당 항이 0에 가까워지고 연쇄법칙을 타고 생성기의 기울기까지 사라진다. 이를 다루는 원칙적인 접근으로 어스 무버 거리에서 출발하는 바서슈타인 GAN이 소개되고, 노이즈 추가나 레이블 스무딩 같은 경험적 요령도 함께 언급된다. 또 다른 실패는 모드 붕괴로, 생성기가 숫자 하나만 계속 만들다 판별기가 그것을 가짜로 판정하면 다른 숫자로 갈아타며 전체 분포로 확장되지 못한다. 젠슨-섀넌 다이버전스가 본래 모드를 좇는 성질을 가진 것이 한 원인으로 지목된다.
첫 번째 심화 주제는 목적함수의 확장이다. 데이터가 두 봉우리를 가진 혼합 분포인데 봉우리 하나짜리 모델로 근사해야 하는 상황에서, KL 다이버전스는 두 봉우리를 모두 덮으려 하고 젠슨-섀넌은 한쪽만 잘 맞추는 식으로 서로 다른 결과를 낸다. 강의는 두 분포의 비를 볼록 함수로 평가하는 f-다이버전스 계열을 소개하고, 볼록 함수를 곡선 대신 접선의 집합으로 표현하는 펜첼 켤레의 쌍대성을 이용해 임의의 f-다이버전스에 대한 하한을 유도한다. 그 하한이 GAN의 목적함수와 같은 꼴이 되므로, 판별기를 신경망으로 매개변수화하면 어떤 다이버전스든 GAN 방식으로 최적화할 수 있다.
남은 두 주제는 잠재변수 추론과 도메인 변환이다. GAN의 생성기는 가역이 아니고 변분 오토인코더처럼 보조 추론망도 없어 데이터에서 잠재변수를 되찾기 어려운데, 판별기의 마지막 층을 떼고 직전 활성값을 표현으로 쓰는 손쉬운 방법 대신 인코더를 추가해 판별기가 (Z, G(Z)) 쌍과 (X, E(X)) 쌍을 구분하게 하는 양방향 GAN이 원칙적인 답으로 제시된다. 도메인 변환에서는 신발 윤곽선과 채색된 신발처럼 짝이 있으면 지도학습으로 풀 수 있지만 사진과 회화처럼 같은 장면의 쌍을 모을 수 없는 경우가 문제인데, 사이클GAN은 사진을 그림으로 바꿨다가 되돌리면 원본이 나와야 한다는 순환 일관성 제약을 더해 모델이 원본의 세부를 보존하도록 만든다. 강의는 GAN이 훌륭한 샘플을 만들지만 학습이 어렵다는 정리로 마무리된다.
주요 인사이트
- GAN의 강점과 약점은 같은 뿌리에서 나온다. 확률식을 지정하지 않아 표현력을 얻는 대신, 학습 목표가 미니맥스 게임이 되어 불안정해진다.
- 판별기를 '가짜 탐지기'가 아니라 '학습되는 검정 통계량'으로 보면 이후 확장이 자연스럽게 이해된다. f-GAN도 결국 통계량의 자리에 다른 함수를 넣는 일이다.
- 다이버전스 선택은 취향이 아니라 근사 실패 시의 행동을 결정한다. 모델이 데이터를 완벽히 담지 못할 때 어디를 포기할지가 목적함수에 따라 달라진다.
- 이산 데이터에서 GAN이 잘 쓰이지 않는 이유는 명확하다. 생성기의 샘플링 과정을 거슬러 미분해야 하는데 이산 공간에서는 미분이 되지 않기 때문이다.
- 순환 일관성은 데이터 부족을 구조로 대신한 사례다. 쌍 데이터를 모을 수 없을 때 '되돌릴 수 있어야 한다'는 제약이 지도 신호 역할을 한다.
자주 묻는 질문
GAN을 암묵적 모델이라고 부르는 이유는 무엇인가요?
생성기가 분포의 수식을 내놓지 않고 샘플을 직접 만들어 내기 때문입니다. 샘플들이 출력 공간에 흩어지며 어떤 분포를 형성하지만 그 분포의 공식을 명시하지는 않으므로, 분포가 샘플을 통해 암묵적으로 정의된다고 말합니다.
판별기가 너무 강하면 왜 학습이 멈추나요?
판별기가 가짜 데이터를 거의 확실하게 가려내면 해당 손실 항의 값이 0에 가까워집니다. 연쇄법칙으로 역전파할 때 이 값이 생성기 기울기에 곱해지므로 기울기가 사실상 사라지고, 생성기는 가중치를 어느 방향으로 고쳐야 할지 알 수 없게 됩니다.
f-GAN은 기존 GAN과 무엇이 다른가요?
기존 GAN은 사실상 젠슨-섀넌 다이버전스를 최적화합니다. f-GAN은 볼록 켤레의 쌍대성을 이용해 KL이나 전변동 거리 같은 임의의 f-다이버전스에 대한 하한을 GAN과 같은 미니맥스 형태로 유도하고, 판별기를 신경망으로 두어 그 목적함수를 최적화합니다.
사이클GAN의 순환 일관성은 어떤 역할을 하나요?
짝지어진 데이터가 없으면 생성기가 그럴듯한 결과물을 만들되 원본과의 관계는 잃기 쉽습니다. 순환 일관성은 사진을 그림으로 바꾼 뒤 다시 사진으로 되돌렸을 때 원본과 같아야 한다는 제약으로, 모델이 되돌리는 데 필요한 세부를 유지하도록 만듭니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗