AI VIDEO BRIEFING

확산 모델(Diffusion Model) 작동 원리: 노이즈를 제거해 AI 이미지를 생성하는 과정

AI 이미지는 알아볼 수 없는 무작위 노이즈에서 시작한다. 확산 모델이 노이즈를 더했다가 거꾸로 제거하며 그림을 만들어내는 순방향·역방향 과정, CLIP 텍스트 조건화, UNet과 잠재공간까지 쉽고 자세하게 정리했다.

노이즈에서 그림을 ‘발굴’한다: 확산 모델이 이미지를 만드는 원리 영상 대표 이미지

핵심 메시지

  • 확산 모델은 이미지를 ‘만드는’ 것이 아니라 노이즈를 ‘제거’해 숨어 있던 형상을 드러낸다.
  • 학습은 이미지에 노이즈를 조금씩 더해 완전한 잡음으로 만드는 순방향 과정과, 그 노이즈를 예측하는 훈련으로 이뤄진다.
  • 생성은 순수한 잡음에서 시작해 예측한 노이즈를 반복해서 빼며 구조를 되살리는 역방향 과정이다.
  • 텍스트 프롬프트는 CLIP을 통해 좌표(벡터)로 바뀌어, 노이즈 제거 방향을 원하는 설명 쪽으로 이끈다.
  • 스테이블 디퓨전 등은 원본 픽셀이 아니라 압축된 잠재공간에서 UNet으로 계산해 훨씬 빠르다.

쉽게 이해하기

우리가 본 모든 AI 생성 이미지는 알아볼 수 없는 순수한 잡음(static)에서 출발한다. 무언가를 더해 만든다는 통념과 달리, 확산 모델은 반대로 노이즈를 없애는 방식으로 작동한다. 영상은 이 과정을 ‘창작’이 아니라 잡음 속에 이미 있던 형상을 파내는 ‘발굴’에 비유한다.

핵심은 두 방향의 과정이다. 먼저 순방향 과정에서 사진이든 그림이든 원본 이미지에 아주 작은 노이즈를 조금씩 더한다. 이를 수천 단계 반복하면 원본은 완전히 사라지고 잡음만 남는데, 각 단계에서 얼마만큼의 노이즈를 더했는지는 정확히 알고 있다.

모델에게는 이렇게 흐려진 이미지들을 보여주며 ‘여기 더해진 노이즈가 무엇이냐’를 맞히게 한다. 살짝 흐린 것부터 완전한 잡음까지 모든 손상 단계에서 노이즈 패턴을 인식하도록 학습시키는 것이다. 노이즈를 예측할 수 있으면 그것을 빼낼 수 있다는 것이 전체의 토대다.

생성 단계에서는 순수한 잡음에서 시작해 ‘여기 어떤 노이즈가 보이느냐’를 묻고, 모델의 예측만큼 빼낸다. 이 과정을 수천 번 반복하면 가장자리가 잡히고 색이 안정되며 세부가 또렷해져, 잡음이 이미지로 바뀐다. 모델은 구도나 색채 이론을 배운 적이 없고, 오직 노이즈를 알아보고 제거하는 능력만으로 이를 해낸다.

원하는 그림을 얻으려면 방향을 줘야 한다. 스테이블 디퓨전 같은 모델은 CLIP이라는 두 번째 신경망과 짝을 이루는데, CLIP은 이미지와 언어를 같은 수학적 공간에 대응시킨다. 프롬프트를 입력하면 그 문장이 의미 공간의 한 점(벡터)으로 바뀌고, 매 단계의 노이즈 제거를 그 설명 쪽으로 끌어당긴다. 실제 계산은 UNet이라는 U자형 신경망이 맡고, 원본 픽셀이 아닌 압축된 잠재공간에서 이뤄져 속도가 크게 빨라진다.

주요 인사이트

  • ‘생성’처럼 보이는 결과가 사실은 대규모 패턴 인식이다. 모델의 유일한 기술은 어떤 규모에서든 노이즈를 알아보고 제거하는 것뿐이며, 이 능력을 반복 적용해 혼돈을 정돈된 이미지로 바꾼다.
  • 텍스트 조건화 덕분에 같은 시작 잡음이라도 프롬프트가 다르면 완전히 다른 결과가 나온다. 노이즈 제거가 무작위가 아니라 언어가 가리키는 방향으로 ‘조향’되기 때문이다.
  • UNet의 스킵 연결은 압축 과정에서 사라질 정보를 가로질러 전달해 세부를 보존한다. 잠재공간에서 작업하는 설계는 같은 확산 개념을 훨씬 작은 캔버스에서 돌려 계산 비용을 낮춘다.
  • 영상은 미켈란젤로의 ‘다비드를 조각한 것이 아니라 다비드가 아닌 돌을 걷어냈을 뿐’이라는 말을 인용해, 확산 모델이 잡음 속에 이미 존재하던 형상을 드러낼 뿐이라고 설명한다.

자주 묻는 질문

확산 모델은 이미지를 어떻게 학습하나요?

원본 이미지에 노이즈를 조금씩 여러 단계로 더해 완전한 잡음으로 만드는 순방향 과정을 거치고, 각 단계마다 더해진 노이즈가 무엇인지 모델이 예측하도록 훈련합니다. 노이즈를 예측할 수 있으면 반대로 제거할 수 있습니다.

텍스트 프롬프트는 어떻게 이미지에 반영되나요?

CLIP이라는 신경망이 이미지와 언어를 같은 수학 공간에 매핑합니다. 입력한 문장은 이 공간의 한 점(벡터)이 되어, 매 단계의 노이즈 제거를 그 설명이 가리키는 방향으로 이끕니다.

스테이블 디퓨전이 빠른 이유는 무엇인가요?

원본 픽셀이 아니라 압축된 표현인 잠재공간(latent space)에서 같은 확산 과정을 수행하기 때문입니다. 캔버스가 작아져 계산량이 크게 줄어듭니다.

원문과 출처

이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.

YouTube 원본 영상 보기 ↗

관련 AI 소식