VAE와 GAN 원리 정리, 잠재공간과 재파라미터화 트릭부터 GAN 학습 실패 모드까지
AI 안전 교육 프로그램 ARENA 강의를 정리했다. 오토인코더의 한계에서 출발해 VAE가 잠재공간에 분포를 학습시키는 이유, 역전파를 살리는 재파라미터화 트릭, GAN의 적대적 학습 구조와 실패 모드를 담았다.
핵심 내용 읽기 →AI TOPIC
딥러닝 기초 관련 핵심 뉴스와 활용 인사이트 22편을 최신순으로 모았습니다.

AI 안전 교육 프로그램 ARENA 강의를 정리했다. 오토인코더의 한계에서 출발해 VAE가 잠재공간에 분포를 학습시키는 이유, 역전파를 살리는 재파라미터화 트릭, GAN의 적대적 학습 구조와 실패 모드를 담았다.
핵심 내용 읽기 →
AI 안전 교육 프로그램 ARENA의 역전파 강의를 정리했다. 연쇄법칙을 이용한 기울기 재활용, 계산 그래프와 레시피, 잎 노드와 위상 정렬까지 파이토치가 뒤에서 대신해 주던 일을 직접 구현하며 배우는 과정을 담았다.
핵심 내용 읽기 →
트랜스포머 인코더가 CNN의 지역 필터, RNN의 순차 처리와 무엇이 다른지 정리했다. 어순에 얽매이지 않는 구조와 먼 단어를 직접 잇는 자기어텐션이 장기 기억 문제와 기울기 소실을 어떻게 비껴가는지 살펴본다.
핵심 내용 읽기 →
트랜스포머 디코더가 번역에서 시작 토큰부터 단어를 하나씩 만들어 가는 과정과, 학습할 때는 정답 문장을 넣어 주는 교사 강요 방식의 차이를 정리했다. 마스크 self-attention이 왜 필요한지도 함께 짚는다.
핵심 내용 읽기 →
트랜스포머 강의 시리즈의 첫 편이 셀프 어텐션을 가중평균이라는 한 가지 개념으로 풀어낸다. 단어 벡터에 문맥 정보를 더하는 과정과 쿼리·키 행렬이 왜 필요한지를 짧은 예문 하나로 차근차근 따라가며 설명한다.
핵심 내용 읽기 →
한국어 스터디 모임이 정리한 대규모 언어 모델 입문 내용을 담았다. 머신러닝과 딥러닝, LLM의 관계에서 시작해 사전학습과 파인튜닝의 분업, 인코더와 디코더의 역할 차이, 환각을 다루는 방법까지 차례로 짚는다.
핵심 내용 읽기 →
루이스 세라노가 단어 몇 개짜리 초소형 모델로 어텐션을 뜯어본다. 단어 사이 영향력이 한쪽으로 기운다는 사실에서 출발해, 왜 임베딩 하나로는 부족하고 키와 쿼리 행렬을 따로 두어야 하는지를 3차원 공간에서 손으로 계산해 보여준다.
핵심 내용 읽기 →
'the cat'이라는 짧은 문장에서 cat 토큰 하나가 토크나이저와 임베딩, 인과 어텐션, MLP를 거쳐 다음 단어가 정해지기까지의 전 과정을 단계별로 따라가며 LLM 내부에서 벌어지는 일을 풀어낸다.
핵심 내용 읽기 →
신경망이 고양이 사진을 알아보기까지 무슨 일이 벌어질까. 손실 함수로 오차를 재고, 경사하강법으로 내리막을 찾고, 역전파로 각 가중치의 책임을 되짚는 학습의 전 과정을 4분짜리 해설 영상을 따라 차근히 정리했다.
핵심 내용 읽기 →
GPT를 떠받치는 트랜스포머 구조를 100초로 압축한 설명. 문장 전체를 한꺼번에 보는 셀프 어텐션, 인코더와 디코더의 역할 분담, 트랜스포머라는 이름의 유래, 그리고 이 구조가 아직 넘지 못한 한계까지 짚었다.
핵심 내용 읽기 →
문장 두 개와 단어 네 개로 만든 초소형 트랜스포머에 어텐션을 붙여가며 쿼리와 키, 밸류 행렬, 스케일드 내적, 소프트맥스가 각각 무슨 일을 하는지 직관으로 풀어낸 강의입니다. 키와 쿼리를 둘로 나누는 이유도 짚습니다.
핵심 내용 읽기 →
안드레이 카파시의 makemore 4편 강의를 정리했다. 자동미분을 끄고 역전파를 텐서 수준에서 손으로 구현하며 얻는 디버깅 감각, 그리고 교차엔트로피와 배치정규화를 한 줄로 줄이는 해석적 미분식을 다룬다.
핵심 내용 읽기 →
안드레이 카파시가 벤지오의 2003년 논문을 따라 다층 퍼셉트론 언어 모델을 직접 구현한다. 임베딩 테이블부터 미니배치, 학습률 탐색, 학습·검증·테스트 분할까지 딥러닝의 기본기를 코드로 하나씩 짚어간다.
핵심 내용 읽기 →
안드레 카파시가 빈 주피터 노트북에서 시작해 자동미분 엔진 마이크로그래드를 한 줄씩 직접 만들며 역전파와 경사하강법을 설명한다. 미분의 의미를 잡는 단계부터 파라미터 41개짜리 신경망을 실제로 학습시키기까지의 흐름과, 강의 중 드러난 흔한 버그까지 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS229 2026년 봄학기 8강은 미분 가능한 회로라면 기울기 계산 비용이 함수 계산 비용과 같다는 정리에서 출발해, 연쇄법칙을 모듈별 역방향 함수로 재해석하고 선형 계층과 활성화 함수의 역전파 공식을 직접 유도했다.
핵심 내용 읽기 →
스탠퍼드 CS229 2026년 봄학기 신경망 첫 강의 정리. 파라미터에 대한 비선형이란 무엇인지부터 확률적 경사하강법을 쓰는 진짜 이유, ReLU와 잔차 연결, 레이어 정규화까지 딥러닝의 기본 부품을 차례로 훑는다.
핵심 내용 읽기 →
초창기 연구자들은 신경망이 지역 최솟값에 갇힐 것이라며 경사하강법을 외면했다. 라마 모델의 손실 지형을 직접 그려 보며 왜 그 예측이 빗나갔는지, 고차원 공간에서 학습이 실제로 어떻게 일어나는지 살펴본다.
핵심 내용 읽기 →
신경망은 흔히 뇌를 본뜬 구조로 소개되지만, 뿌리를 따라가면 가우스가 사라진 소행성 세레스를 찾을 때 쓴 곡선 맞추기에 닿는다. 선형대수와 미적분 없이 신경망의 정체를 설명한 영상을 따라 ReLU 뉴런과 층 쌓기의 의미까지 정리했다.
핵심 내용 읽기 →
28x28 픽셀 손글씨 숫자를 인식하는 가장 단순한 신경망을 따라가며 뉴런, 액티베이션, 가중치, 바이어스가 각각 무슨 일을 하는지 그림처럼 풀어 설명한 강의를 정리했다.
핵심 내용 읽기 →
사기 탐지도 보험료 산정도 해내던 기계 학습이 유독 이미지 앞에서는 무너졌다. 그 원인이 학습 능력이 아니라 입력 차원에 있었다는 설명과, 합성곱 신경망이 이를 우회한 방식을 정리했다.
핵심 내용 읽기 →
신경망과 언어 모델이 학습하는 바탕에 있는 알고리즘, 경사하강법을 100초로 정리한 영상. 오차 지형에서 가장 낮은 지점을 찾아 내려가는 방식과 학습률, 미니배치, 모멘텀, 학습률 스케줄 같은 개념을 쉬운 비유로 풀어본다.
핵심 내용 읽기 →
안드레이 카파시의 GPT 직접 만들기 강의 전반부에 나오는 바이그램 언어 모델을 셰익스피어 데이터 예제로 풀어, 토큰·임베딩 표·손실·소프트맥스 개념을 정리한다.
핵심 내용 읽기 →