vLLM 선정 과정과 페이지드 어텐션·연속 배칭 원리: 카카오페이 LLM 서빙 최적화 사례 정리
카카오페이 팀이 네 개의 LLM 서빙 프레임워크를 직접 비교하고 실험한 과정을 공개했다. 최종적으로 vLLM을 고른 기준과, GPU 메모리 낭비를 줄이는 페이지드 어텐션·연속 배칭의 원리를 함께 설명한다.
핵심 내용 읽기 →AI TOPIC
GPU 최적화 관련 핵심 뉴스와 활용 인사이트 11편을 최신순으로 모았습니다.

카카오페이 팀이 네 개의 LLM 서빙 프레임워크를 직접 비교하고 실험한 과정을 공개했다. 최종적으로 vLLM을 고른 기준과, GPU 메모리 낭비를 줄이는 페이지드 어텐션·연속 배칭의 원리를 함께 설명한다.
핵심 내용 읽기 →
IBM 테크놀로지가 UC 버클리에서 출발한 오픈소스 추론 엔진 vLLM을 소개하며 GPU 메모리 낭비와 응답 지연, 확장의 어려움을 페이지드 어텐션과 연속 배치로 푸는 원리와 실제 도입 방법을 설명했다.
핵심 내용 읽기 →
서울대 AI 콜로퀴움에서 서지원 교수가 딥러닝 학습과 LLM 추론의 GPU 저활용 문제를 해부했다. 역전파 순서를 바꾸는 아웃오브오더 백프롭과, 토큰 지연시간 제약을 지키며 처리량을 최대화하는 추론 스케줄링을 소개한다.
핵심 내용 읽기 →
GPU 행렬곱 커널을 가장 느린 형태부터 직접 고쳐 나가며 cuBLAS 성능에 다가간 기록이다. 메모리 접근 정렬, 타일링, 벡터화 로드, 텐서코어, 더블 버퍼링을 거쳐 CUTLASS가 왜 필요한지 짚는다.
핵심 내용 읽기 →
사전학습용 4비트 양자화 레시피는 강화학습에서 그대로 통하지 않는다. 토큰 단위 스케일링과 블록별 적응형 인코딩, 역전파 처리 방식 선택으로 그래디언트 붕괴를 막아 낸 실전 사례를 단계별로 정리했다.
핵심 내용 읽기 →
LLM 추론에서 GPU 메모리의 60~80%를 낭비하게 만드는 KV 캐시 단편화 문제를, 운영체제의 페이징 기법으로 해결한 PagedAttention의 작동 원리와 접두어 공유·연속 배칭의 효과를 정리했다.
핵심 내용 읽기 →
메타 엔지니어가 발표한 torch.compile의 CUDA 스트림 지원 정리. 스트림 컨텍스트에서 그래프가 끊기던 문제를 Dynamo·AOT Autograd·Inductor 세 단계에서 어떻게 풀었는지와, 활성값 오프로딩의 실측 결과를 다뤘다.
핵심 내용 읽기 →
우마르 자밀이 Mamba 논문을 바닥부터 풀어냈다. 미분방정식과 이산화로 상태공간모델을 세우고, 기존 S4가 선택적 복사에 실패한 이유와 Mamba의 선택적 스캔·커널 융합이 이를 푼 방식을 짚는다.
핵심 내용 읽기 →
사용자가 늘수록 LLM 응답이 느려지는 원인은 모델이 아니라 메모리 사용 방식이다. KV 캐시와 PagedAttention이 어떻게 GPU 처리량을 끌어올리는지, vLLM 설정 팁까지 정리했다.
핵심 내용 읽기 →
중국 AI 랩 미니맥스가 M3 모델에서 풀 어텐션을 스파스 어텐션으로 바꿔 100만 토큰 기준 토큰당 연산을 1/20로 줄였다. GPU 메모리 병목과 최적화 기법을 쉽게 풀이한다.
핵심 내용 읽기 →
트랜스포머의 셀프 어텐션이 왜 느리고 메모리를 많이 쓰는지, 그리고 타일링과 온라인 소프트맥스를 결합한 플래시 어텐션이 정확도를 그대로 지키면서 GPU 메모리 접근을 줄여 어떻게 속도를 끌어올리는지 쉽게 정리했다.
핵심 내용 읽기 →