LLM 모델 압축 총정리: 양자화·가지치기·지식 증류·저랭크 분해 서베이 논문 스터디 발표 요약
거대 언어 모델을 적은 자원에서 돌리기 위한 압축 기법을 네 갈래로 정리한 스터디 발표다. 양자화와 가지치기의 성능 차이, 지식 증류의 두 방식, 그리고 실제 추론 속도 이득의 한계까지 함께 다룬다.
핵심 내용 읽기 →AI TOPIC
지식 증류 관련 핵심 뉴스와 활용 인사이트 15편을 최신순으로 모았습니다.

거대 언어 모델을 적은 자원에서 돌리기 위한 압축 기법을 네 갈래로 정리한 스터디 발표다. 양자화와 가지치기의 성능 차이, 지식 증류의 두 방식, 그리고 실제 추론 속도 이득의 한계까지 함께 다룬다.
핵심 내용 읽기 →
대학 LLM 강의의 마지막 회차가 최신 사후학습 기법을 정리한다. RLVR과 RLHF의 차이, 합성 데이터의 가능성과 모델 붕괴 위험, 온폴리시 증류와 다중 교사 방식까지 최근 공개 모델의 실제 학습 레시피로 짚는다.
핵심 내용 읽기 →
CAD 원본 없이 메시나 포인트 클라우드만으로 표면의 가공 방식을 알아내려는 시도. 설계 의도를 담은 B-rep 인코더의 관계 지식을 학생 모델로 옮겨 필렛과 챔퍼 같은 모서리 가공 인식을 끌어올렸다.
핵심 내용 읽기 →
허깅페이스 연구팀이 약한 모델에서 강한 모델로의 일반화를 다룬 논문을 토론했다. 작은 모델의 강화학습 전후 정책 변화를 보상 신호로 삼아 더 큰 모델을 학습시키는 방식의 비용 절감 효과와 적용 조건, 남은 한계를 정리했다.
핵심 내용 읽기 →
앤트로픽이 중국 AI 랩 세 곳의 대규모 증류를 지목하자 오픈AI와 구글도 잇달아 문서를 냈다. 증류가 기술적으로 무엇이고, 지목한 쪽의 데이터 취득 이력까지 놓고 보면 왜 이 논쟁이 간단하지 않은지 정리했다.
핵심 내용 읽기 →
확산 기반 LLM은 여러 토큰을 한 번에 만들 수 있는데도 KV 캐시를 쓸 수 없어 실제로는 느렸다. 시퀀스를 블록으로 나눠 두 장점을 함께 취한 D2F 방식과 자기회귀 모델을 처음 앞지른 실험 결과를 정리했다.
핵심 내용 읽기 →
독수리를 좋아하도록 유도한 교사 모델이 만든 숫자 나열만으로 학생 모델을 학습시켰더니 학생도 독수리를 좋아하게 됐다. 2025년 보고된 잠재 학습 현상과 그 수학적 설명, 그리고 AI 안전에 남긴 숙제를 정리했다.
핵심 내용 읽기 →
작고 빠른 모델에 거대 모델의 능력을 옮기는 지식 증류의 원리를 소프트 타깃, 온도, KL 발산, 노출 편향, 온폴리시 증류까지 단계별로 쉽게 설명한다.
핵심 내용 읽기 →
사람이 붙인 라벨 없이 이미지만으로 특징을 학습하는 자기지도학습의 원리를, CLIP과 SimCLR부터 DINO·DINOv2·DINOv3의 학생-교사 구조와 센터링·멀티크롭·그램 앵커링까지 단계별로 쉽게 설명합니다.
핵심 내용 읽기 →
스노클 AI 연구자가 소개하는 모델 증류 전략. 거대 범용 LLM을 교사로 삼아 작은 특화 모델을 학습시키고, 근거(rationale)를 함께 증류하는 '단계별 증류'로 데이터와 비용을 크게 줄이는 방법을 정리했다.
핵심 내용 읽기 →
큰 교사 모델의 지식을 작은 학생 모델로 압축하는 지식 증류의 개념과 역사, 로짓 매칭과 다크 널리지, 온도 조절 소프트맥스의 원리를 예제와 함께 설명한다.
핵심 내용 읽기 →
학습한 신경망을 추론 단계에서 더 빠르고 가볍게 만드는 네 가지 방법 - 양자화, 프루닝, 지식 증류, 엔지니어링 최적화의 원리와 장단점을 정리했다.
핵심 내용 읽기 →
정상 데이터만 학습한 학생-교사 모델이 결함을 탐지하는 지식 증류의 원리와, Uninformed Students·MKD·RD4AD·AST로 이어지는 발전 흐름을 DMQA 세미나로 정리했다.
핵심 내용 읽기 →
10억 파라미터 미만의 소형 언어모델을 직접 파인튜닝하는 전 과정. Gemma 3 270M을 커스텀 데이터로 학습해 구조화 데이터를 추출하고, 허깅페이스에 올려 데모까지 공개하는 방법을 정리했다.
핵심 내용 읽기 →
큰 LLM이 작은 모델을 가르치는 지식 증류의 개념을, 2006년 모델 압축부터 힌턴의 2015년 논문, 소프트 라벨과 온도, 그리고 제대로 된 증류와 행동 복제의 차이까지 정리했습니다.
핵심 내용 읽기 →