롱컨텍스트 LLM 추론 최적화 완전 정리: KV 캐시 병목부터 MagicPIG 샘플링 기법까지
컨텍스트가 길어질수록 LLM이 느려지는 진짜 이유는 연산량이 아니라 KV 캐시 전송이다. CMU 초청 강의가 정리한 압축의 한계와 추측 디코딩·MagicPIG 대안, 긴 문맥 추론 능력을 재는 새 평가 방식을 함께 짚는다.
핵심 내용 읽기 →AI TOPIC
LLM 추론 최적화 관련 핵심 뉴스와 활용 인사이트 7편을 최신순으로 모았습니다.

컨텍스트가 길어질수록 LLM이 느려지는 진짜 이유는 연산량이 아니라 KV 캐시 전송이다. CMU 초청 강의가 정리한 압축의 한계와 추측 디코딩·MagicPIG 대안, 긴 문맥 추론 능력을 재는 새 평가 방식을 함께 짚는다.
핵심 내용 읽기 →
구글 리서치가 ICML 2023에서 발표한 스페큘레이티브 디코딩은 작은 초안 모델이 토큰 여러 개를 먼저 제안하고 큰 모델이 한 번에 검증하는 구조다. 출력 결과를 전혀 바꾸지 않으면서 생성 속도만 끌어올린다.
핵심 내용 읽기 →
마이크로소프트 리서치 인도 학술 서밋의 시스템 세션 발표 다섯 건을 정리했다. 롱컨텍스트 어텐션 근사부터 가속기 데이터 이동 비용, ML 파이프라인의 조용한 오류, 프리필·디코드 분리 운영, 재생에너지 데이터센터까지 다룬다.
핵심 내용 읽기 →
작은 초안 모델이 토큰을 미리 찍고 큰 타깃 모델이 한 번의 순전파로 검증하는 추측 디코딩. 출력 품질이 수학적으로 보존되는 이유와 세 가지 구현 방식, 그리고 오히려 쓰지 말아야 할 상황까지 정리했다.
핵심 내용 읽기 →
추측 디코딩의 초안 모델을 없애고 모델 스스로 자기 출력을 추측하게 만드는 야코비 포싱의 원리와 한계를, 확산 기반 생성과 비교해 정리했다.
핵심 내용 읽기 →
작은 드래프트 모델이 고른 후보 토큰만 살펴 조기 종료 판단 비용을 줄인 SpecEE 논문 리뷰. 라마2 7B에서 클라우드 2.25배, PC 2.43배 속도를 얻은 세 가지 최적화와 정확도 손실을 정리했다.
핵심 내용 읽기 →
거대 언어 모델은 토큰을 하나씩 만드느라 느리다. 작고 빠른 초안 모델과 크고 정확한 목표 모델을 함께 쓰는 추측 디코딩은 거부 샘플링으로 정확도를 그대로 유지하면서 추론 속도를 2~3배 끌어올린다.
핵심 내용 읽기 →