스테이블 디퓨전 원리와 검색 증강 확산 모델 정리 — 뵈른 옴머 교수의 찰머스 공대 초청 강연 요약
스테이블 디퓨전을 만든 연구팀이 확산 모델의 낭비를 줄인 두 가지 방법을 설명한 강연이다. 잠재 공간 압축과 외부 패치 데이터베이스 검색으로, 모델 크기를 키우지 않고도 품질과 속도를 함께 끌어올린 과정을 정리했다.
핵심 내용 읽기 →AI TOPIC
모델 경량화 관련 핵심 뉴스와 활용 인사이트 13편을 최신순으로 모았습니다.

스테이블 디퓨전을 만든 연구팀이 확산 모델의 낭비를 줄인 두 가지 방법을 설명한 강연이다. 잠재 공간 압축과 외부 패치 데이터베이스 검색으로, 모델 크기를 키우지 않고도 품질과 속도를 함께 끌어올린 과정을 정리했다.
핵심 내용 읽기 →
전력망도 기지국도 없는 코스타리카 국립공원에서 멸종위기 새를 추적한 사례. 라즈베리 파이와 BirdNet 대신 신호처리와 100KB 모델을 택해 배터리 수명과 오탐 문제를 함께 푼 과정을 정리했다.
핵심 내용 읽기 →
생성형 AI에 가려졌던 타이니ML이 다시 주목받고 있다. 메타 엔지니어들이 파이토치 콘퍼런스에서 공개한 ExecuTorch의 마이크로컨트롤러 지원 현황과, 램이 10MB도 안 되는 기기에서 쓰는 실전 용량 절감 요령을 정리했다.
핵심 내용 읽기 →
70억 파라미터 모델은 32비트로 저장하면 28GB가 필요하다. 이 무게를 줄이는 양자화의 원리와 대칭·비대칭 방식의 차이, 구간 끝값 선택 기준, 학습 후 양자화와 양자화 인식 학습의 차이까지 정리했다.
핵심 내용 읽기 →
혼합 전문가(MoE)는 토큰마다 일부 전문가만 깨워 밀집 모델급 품질을 더 적은 연산으로 낸다. 라우터의 상위 k개 선택, 로드 밸런싱 손실, 전문가 용량, GPU 간 통신 병목까지 실제 작동 원리를 정리했다.
핵심 내용 읽기 →
생성형 AI 확산이 데이터센터 전력과 탄소 배출을 어떻게 밀어올렸는지, 그리고 모델 선택·학습 시점·경량화로 무엇을 줄일 수 있는지 정리했습니다.
핵심 내용 읽기 →
긴 문맥 LLM의 메모리를 잡아먹는 KV 캐시를 3비트로 압축하는 TurboQuant를 정리했다. 좌표가 아니라 어텐션 점수를 보존하는 아다마르 전처리, 유니버설 코드북, 1비트 잔차 보정의 원리를 살펴본다.
핵심 내용 읽기 →
작은 드래프트 모델이 고른 후보 토큰만 살펴 조기 종료 판단 비용을 줄인 SpecEE 논문 리뷰. 라마2 7B에서 클라우드 2.25배, PC 2.43배 속도를 얻은 세 가지 최적화와 정확도 손실을 정리했다.
핵심 내용 읽기 →
거대 LLM을 개인 PC에서 돌리는 핵심 기술인 양자화의 원리와, GPTQ·AWQ·GGUF를 하드웨어와 용도에 맞게 고르는 실전 기준을 정리했습니다.
핵심 내용 읽기 →
FP16을 4비트, 1비트까지 줄이는 양자화로 63.66MB짜리 LLM을 CPU에서 78토큰/초로 돌린 실험. 모델 경량화가 왜 필요하고 어디까지 무너지는지 유쾌하게 짚었다.
핵심 내용 읽기 →
딥러닝 모델을 경량화하는 양자화의 원리, 스케일·제로포인트 계산, PTQ와 QAT, 그리고 아웃라이어를 다루는 SmoothQuant·SpinQuant까지 DMQA 세미나로 정리했다.
핵심 내용 읽기 →
수백억 파라미터 LLM을 소비자용 하드웨어에서 돌리게 해주는 양자화의 원리를, 부동소수점 표현부터 8비트·4비트 압축, 성능 비교, GGUF·llama.cpp까지 정리합니다.
핵심 내용 읽기 →
휴대폰·마이크로컨트롤러 같은 엣지 기기에 무거운 딥러닝 모델을 올리기 위해 모델 크기를 줄이는 양자화 기법을, 사후 양자화와 양자화 인식 학습 두 방식으로 나눠 설명합니다.
핵심 내용 읽기 →