LLM 추론 최적화 총정리: KV 캐시, 연속 배칭, 페이지드 어텐션, 추측 디코딩과 서빙 지표
대학 LLM 강의가 추론 서빙 기술을 한자리에 정리했다. 프리필과 디코드가 왜 다른지, TTFT·TPOT·굿풋은 무엇을 재는 지표인지, 페이지드 어텐션과 연속 배칭·추측 디코딩·양자화가 서빙 비용을 어떻게 줄이는지 짚었다.
핵심 내용 읽기 →AI TOPIC
페이지드 어텐션 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

대학 LLM 강의가 추론 서빙 기술을 한자리에 정리했다. 프리필과 디코드가 왜 다른지, TTFT·TPOT·굿풋은 무엇을 재는 지표인지, 페이지드 어텐션과 연속 배칭·추측 디코딩·양자화가 서빙 비용을 어떻게 줄이는지 짚었다.
핵심 내용 읽기 →
카카오페이 팀이 네 개의 LLM 서빙 프레임워크를 직접 비교하고 실험한 과정을 공개했다. 최종적으로 vLLM을 고른 기준과, GPU 메모리 낭비를 줄이는 페이지드 어텐션·연속 배칭의 원리를 함께 설명한다.
핵심 내용 읽기 →
로컬 LLM 추론 엔진 vLLM이 올라마보다 빠른 이유를 페이지드어텐션과 연속 배칭 원리로 풀어 보고, 같은 모델로 단일 요청과 다중 요청을 직접 비교한 실측 결과와 개인 사용자에게 주는 의미까지 정리했다.
핵심 내용 읽기 →