LLM 아키텍처 정리: RMS놈·RoPE·SwiGLU가 표준이 된 이유와 학습 안정화 기법
국내 대학 LLM 강의가 라마 계열을 기준으로 프리놈과 RMS놈, 회전 위치 임베딩, SwiGLU 같은 현대 트랜스포머 설계가 표준이 된 이유와 하이퍼파라미터 관례, 소프트맥스 학습 안정화 기법까지 차례로 정리했다.
핵심 내용 읽기 →AI TOPIC
모델 아키텍처 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

국내 대학 LLM 강의가 라마 계열을 기준으로 프리놈과 RMS놈, 회전 위치 임베딩, SwiGLU 같은 현대 트랜스포머 설계가 표준이 된 이유와 하이퍼파라미터 관례, 소프트맥스 학습 안정화 기법까지 차례로 정리했다.
핵심 내용 읽기 →
전문가 혼합(MoE)은 전체 파라미터를 키우면서 실제 연산량은 묶어두는 구조다. 라우팅 방식이 top-k로 수렴한 이유, 딥시크가 퍼뜨린 세분화·공유 전문가, 전문가 붕괴를 막는 로드 밸런싱 손실까지 강의 내용을 정리했다.
핵심 내용 읽기 →
GPT-1부터 라마 3.1까지 6년을 훑으면 아키텍처 변화는 정규화 방식과 활성함수, 위치 인코딩을 손질한 정도로 의외로 작다. 정작 비용과 시간이 가장 많이 몰린 곳은 사전학습 레시피라는 점을 정리했다.
핵심 내용 읽기 →