MIT 6.S191 시퀀스 모델링 강의 정리: 순환 신경망(RNN)의 원리와 한계, 그리고 어텐션과 트랜스포머가 등장한 이유
MIT 딥러닝 입문 강의가 퍼셉트론에서 출발해 순환 신경망과 시간에 따른 역전파, 단어 임베딩, 자기 어텐션까지 이어지는 흐름을 단계별로 설명한다. 기울기 소실이라는 한계에서 트랜스포머가 왜 필요했는지 기초부터 짚어준다.
핵심 내용 읽기 →AI TOPIC
시퀀스 모델링 관련 핵심 뉴스와 활용 인사이트 5편을 최신순으로 모았습니다.

MIT 딥러닝 입문 강의가 퍼셉트론에서 출발해 순환 신경망과 시간에 따른 역전파, 단어 임베딩, 자기 어텐션까지 이어지는 흐름을 단계별로 설명한다. 기울기 소실이라는 한계에서 트랜스포머가 왜 필요했는지 기초부터 짚어준다.
핵심 내용 읽기 →
SNS에서 화제가 된 'Attention Is Not What You Need' 논문을 수학 전공자가 뜯어봤다. 그라스만 다양체 아이디어의 신선함과, 실험 규모·연산 최적화에서 드러난 한계를 정리한다.
핵심 내용 읽기 →
우마르 자밀이 Mamba 논문을 바닥부터 풀어냈다. 미분방정식과 이산화로 상태공간모델을 세우고, 기존 S4가 선택적 복사에 실패한 이유와 Mamba의 선택적 스캔·커널 융합이 이를 푼 방식을 짚는다.
핵심 내용 읽기 →
복잡한 수학 없이도 Mamba를 '선형 RNN의 확장'으로 이해한다. 병렬 스캔, 행렬 대각화, 안정 초기화, 입력 의존 선택 메커니즘까지 트랜스포머를 넘보는 원리를 쉽게 정리했다.
핵심 내용 읽기 →
맘바는 상태공간모델(SSM)을 '선택적'으로 만들어 트랜스포머 수준의 정확도를 선형 시간에 달성했다. SSM이 선형 RNN처럼 작동하는 원리와, 맘바가 긴 시퀀스에서 트랜스포머보다 강한 이유를 정리했다.
핵심 내용 읽기 →