LLM 밑바닥부터 만들기: 토큰화·GPT 아키텍처·사전학습·가중치 로딩·LoRA 파인튜닝 정리
세바스찬 라시카의 3시간 코딩 워크숍을 정리했다. 텍스트 토큰화와 학습 배치 구성부터 GPT 아키텍처, 소규모 사전학습, 공개 가중치 로딩, LoRA 인스트럭션 파인튜닝과 모델 평가까지 LLM 개발 전 과정을 순서대로 짚는다.
핵심 내용 읽기 →AI TOPIC
토큰화 관련 핵심 뉴스와 활용 인사이트 14편을 최신순으로 모았습니다.

세바스찬 라시카의 3시간 코딩 워크숍을 정리했다. 텍스트 토큰화와 학습 배치 구성부터 GPT 아키텍처, 소규모 사전학습, 공개 가중치 로딩, LoRA 인스트럭션 파인튜닝과 모델 평가까지 LLM 개발 전 과정을 순서대로 짚는다.
핵심 내용 읽기 →
언어모델 학습은 글을 숫자로 바꾸는 일에서 시작한다. 토큰화로 문장을 쪼개고 토큰 ID를 붙인 뒤, 바이트 페어 인코딩과 슬라이딩 윈도우, 위치 임베딩까지 이어지는 준비 과정을 실습 강의를 토대로 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS229 2026년 봄학기 14강은 대형 언어모델을 다루는 첫 시간이다. 서브워드 토큰화와 자기회귀 확률 모형에서 출발해 생성 온도, 어텐션의 계산 과정과 마스킹, 긴 문맥이 비싼 이유까지 훑었다.
핵심 내용 읽기 →
대규모 언어 모델이 문장을 토큰으로 쪼개고 숫자와 벡터로 바꿔 다음 단어를 예측하는 과정을 예시로 따라간다. 온도 값과 샘플링이 필요한 이유도 함께 짚는다.
핵심 내용 읽기 →
루이스 세라노가 설명하는 토큰화와 바이트 페어 인코딩(BPE). LLM이 단어나 글자가 아닌 '토큰'으로 텍스트를 처리하는 이유와, 가장 자주 등장하는 글자쌍을 합쳐 토큰을 만드는 BPE의 작동 원리를 예시로 풀어냅니다.
핵심 내용 읽기 →
카파시의 LLM 딥다이브를 따라가며 대형언어모델을 바닥부터 만드는 첫 단계인 사전학습을 살펴본다. 웹 크롤링과 데이터 필터링, 토큰화와 한국어의 비효율, 다음 토큰 예측과 베이스 모델의 정체를 정리한다.
핵심 내용 읽기 →
ChatGPT·Claude·Gemini가 말을 답으로 바꾸는 과정을 단계별로 풀었다. 토큰화, 임베딩, 어텐션, 트랜스포머 층 쌓기, 로짓과 샘플링까지 핵심 원리를 정리한다.
핵심 내용 읽기 →
MIT 강의로 보는 LLM의 작동 원리. 다음 단어 예측 학습, 미래를 못 보게 막는 인과적 어텐션, 그리디·탑K·탑P·온도 같은 디코딩 전략, 그리고 바이트 페어 인코딩(BPE) 토큰화를 차근차근 설명한다.
핵심 내용 읽기 →
대형 언어 모델을 직접 만들어 보는 과정을 사전학습 중심으로 정리합니다. 학습 데이터 준비, 토큰화, 다음 단어 예측, 마스크 셀프 어텐션, 훈련과 결과 확인까지 핵심 흐름을 짚습니다.
핵심 내용 읽기 →
NDC 발표 'Inside GPT'를 정리했습니다. 대형 언어 모델이 텍스트를 토큰으로 바꾸고 임베딩과 어텐션으로 다음 토큰을 예측하며, 온도와 top-p 샘플링으로 무작위성을 더하는 과정을 GPT-2 예시로 풀어냅니다.
핵심 내용 읽기 →
컴퓨터가 텍스트를 처리하려면 숫자로 바꿔야 합니다. 토큰화·벡터화·임베딩이 각각 무엇이고 어떻게 다른지, TF-IDF와 밀집 벡터, 코사인 유사도까지 실습 관점에서 정리했습니다.
핵심 내용 읽기 →
토큰화, 바이트 페어 인코딩, 임베딩, 어텐션, 피드포워드, 예측, 소프트맥스, 온도까지 LLM이 다음 단어를 골라내는 전 과정을 비유로 풀어 설명한다.
핵심 내용 읽기 →
LLM이 프롬프트를 받아 글자를 만들어 내는 과정을 토큰화, 임베딩, 트랜스포머(어텐션), 확률, 샘플링의 5단계로 풀어낸다. 환각과 온도, 컨텍스트 한계가 왜 생기는지까지 짚는다.
핵심 내용 읽기 →
안드레이 카파시가 GPT 토크나이저를 바닥부터 구현하며 바이트 페어 인코딩(BPE)과 UTF-8, 어휘 크기 절충, 비영어·코드 처리 문제까지 토큰화의 원리를 설명한다.
핵심 내용 읽기 →