스탠퍼드 CS336 1강 정리 - 언어모델을 밑바닥부터 만드는 법과 BPE 토크나이저의 원리
스탠퍼드 CS336 첫 강의는 프런티어 모델을 직접 만들 수 없는 시대에도 왜 밑바닥 구현이 필요한지 설명한다. 효율성이라는 하나의 기준, 작은 규모 실험의 함정, 문자·바이트·단어 방식을 거쳐 BPE 토크나이저에 이르는 과정을 정리했다.
핵심 내용 읽기 →AI TOPIC
토크나이저 관련 핵심 뉴스와 활용 인사이트 9편을 최신순으로 모았습니다.

스탠퍼드 CS336 첫 강의는 프런티어 모델을 직접 만들 수 없는 시대에도 왜 밑바닥 구현이 필요한지 설명한다. 효율성이라는 하나의 기준, 작은 규모 실험의 함정, 문자·바이트·단어 방식을 거쳐 BPE 토크나이저에 이르는 과정을 정리했다.
핵심 내용 읽기 →
대학 LLM 강의의 트랜스포머 회차 정리. 어텐션을 확률로 값을 섞는 룩업 테이블에 비유하고, 셀프·크로스 어텐션과 스케일드 닷 프로덕트, BPE 토크나이저, 위치 인코딩, 마스킹, 잔차 연결과 피드포워드까지 차례로 짚는다.
핵심 내용 읽기 →
카네기멜런대 딥러닝 강의가 RNN의 정보 병목과 병렬화 한계에서 출발해 토크나이저 선택, 사인·코사인 위치 인코딩, 멀티헤드 어텐션, 플래시 어텐션과 KV 캐시까지 트랜스포머 설계의 이유를 차례로 풀어낸다.
핵심 내용 읽기 →
스탠퍼드 물리·AI 콘퍼런스 발표 정리. 은하 이미지 64만 장과 같은 트랜스포머 백본으로 네 가지 토크나이저를 비교한 결과, 이미지를 잘 복원하는 방식과 물리량을 잘 담아내는 방식이 서로 달랐다.
핵심 내용 읽기 →
구글 시니어 ML 엔지니어 맥스 버클리가 경영학 학부에서 출발해 분석가와 소프트웨어 엔지니어를 거쳐 머신러닝 팀에 합류하기까지의 경로와, 채용 면접관으로서 실제로 눈에 들어오는 이력을 이야기한다. 기초 강의 이후의 공백을 건너는 방법도 다룬다.
핵심 내용 읽기 →
마이크로소프트 리서치 인도 학술 세션의 다섯 개 발표를 정리했다. 다국어 데이터 격차와 이미지 생성의 지역 편향, 인도 법률 AI, 토크나이저 과분할 문제까지 AI 불평등이 만들어지는 통로를 차례로 짚는다.
핵심 내용 읽기 →
고정된 어휘 사전으로 텍스트를 자르는 대신, 다음 바이트 예측이 불확실해지는 지점에서 바이트를 묶어 패치로 만드는 구조를 다룬다. 두 겹으로 나뉜 모델이 어떻게 연산을 아끼고 무엇을 얻는지, 한계는 무엇인지 정리했다.
핵심 내용 읽기 →
이미지와 소리는 본래 숫자지만 글은 그렇지 않다. 컴퓨터가 단어의 의미를 숫자로 다루게 된 과정을 원-핫 벡터, Word2Vec, 바이트 페어 인코딩까지 따라가며 풀어봤다.
핵심 내용 읽기 →
LLM을 쓰면서도 토큰을 잘 모르는 개발자를 위한 기초 해설이다. 토큰이 무엇이고, 텍스트가 어떻게 숫자로 변환되며, 왜 모델마다 토큰 수와 사용 비용이 달라지는지 토크나이저 작동 원리로 알기 쉽게 풀어본다.
핵심 내용 읽기 →