스탠퍼드 CS25 트랜스포머 입문 정리 — 카파시가 짚은 어텐션의 기원과 nanoGPT 구현
안드레이 카파시가 스탠퍼드 CS25 강의에서 트랜스포머의 역사와 내부 구조를 정리했다. 어텐션이 번역 연습에서 착안된 과정, 메시지 패싱으로 보는 해석, nanoGPT 구현, 그리고 이 구조가 5년째 살아남은 이유를 짚는다.
핵심 내용 읽기 →AI TOPIC
안드레이 카파시 관련 핵심 뉴스와 활용 인사이트 11편을 최신순으로 모았습니다.

안드레이 카파시가 스탠퍼드 CS25 강의에서 트랜스포머의 역사와 내부 구조를 정리했다. 어텐션이 번역 연습에서 착안된 과정, 메시지 패싱으로 보는 해석, nanoGPT 구현, 그리고 이 구조가 5년째 살아남은 이유를 짚는다.
핵심 내용 읽기 →
안드레이 카파시가 makemore 5편에서 다층 퍼셉트론을 웨이브넷식 계층 구조로 바꾸고 문맥을 8자로 늘린 뒤 배치 정규화 버그까지 잡아 검증 손실을 2.10에서 1.993으로 낮추는 과정을 정리했다.
핵심 내용 읽기 →
안드레이 카파시의 makemore 4편 강의를 정리했다. 자동미분을 끄고 역전파를 텐서 수준에서 손으로 구현하며 얻는 디버깅 감각, 그리고 교차엔트로피와 배치정규화를 한 줄로 줄이는 해석적 미분식을 다룬다.
핵심 내용 읽기 →
안드레이 카파시가 벤지오의 2003년 논문을 따라 다층 퍼셉트론 언어 모델을 직접 구현한다. 임베딩 테이블부터 미니배치, 학습률 탐색, 학습·검증·테스트 분할까지 딥러닝의 기본기를 코드로 하나씩 짚어간다.
핵심 내용 읽기 →
안드레이 카파시가 팟캐스트 No Priors에서 코드 에이전트를 여러 개 병렬로 굴리는 개발 방식과 사람을 루프에서 빼는 오토리서치, 오픈소스 모델의 위치, AI 시대의 일자리 전망까지 폭넓게 이야기했다.
핵심 내용 읽기 →
안드레이 카파시가 이름 붙인 바이브 코딩의 뜻을 쉽게 설명한다. AI 에이전트가 코드를 쓰고 사람은 방향을 잡는 개발 방식과, 여전히 남는 과제들을 정리한다.
핵심 내용 읽기 →
안드레이 카파시가 세쿼이아 행사에서 밝힌 '소프트웨어 3.0', 바이브 코딩과 에이전트 엔지니어링의 차이, 들쭉날쭉한 AI의 한계와 사람의 역할을 정리했다.
핵심 내용 읽기 →
안드레이 카파시가 GPT-2(124M)를 PyTorch로 바닥부터 재현한다. 모델 구조와 GPT-3 하이퍼파라미터, torch.compile·플래시 어텐션 최적화, 약 1시간·10달러 학습까지 다룬다.
핵심 내용 읽기 →
안드레이 카파시가 GPT 토크나이저를 바닥부터 구현하며 바이트 페어 인코딩(BPE)과 UTF-8, 어휘 크기 절충, 비영어·코드 처리 문제까지 토큰화의 원리를 설명한다.
핵심 내용 읽기 →
안드레이 카파시가 일반 청중을 위해 ChatGPT 같은 거대 언어모델의 작동 원리를 풀어낸다. 인터넷 데이터 사전학습, 토큰 예측, 지도학습과 강화학습, 추론 모델, 그리고 환각이 생기는 이유까지 전 과정을 단계별로 짚는다.
핵심 내용 읽기 →
카파시가 일상과 업무에서 ChatGPT를 비롯한 LLM을 어떻게 쓰는지 정리했다. 토큰·사고 모델·검색·딥리서치·코드 실행·음성·메모리까지 실전 기능을 한눈에 짚는다.
핵심 내용 읽기 →