인퍼런스 시대의 토큰 팩토리, prefill·decode 분리와 투기적 디코딩이 바꾸는 GPU 경제학
자체 GPU 데이터센터를 지은 국내 AI 스타트업을 찾아간 팟캐스트를 정리했다. 초당 1,000토큰이 나오는 원리부터 prefill과 decode를 분리하는 이유, 감가상각을 버티는 가동률까지 인퍼런스의 경제학을 짚는다.
핵심 내용 읽기 →AI TOPIC
LLM 서빙 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

자체 GPU 데이터센터를 지은 국내 AI 스타트업을 찾아간 팟캐스트를 정리했다. 초당 1,000토큰이 나오는 원리부터 prefill과 decode를 분리하는 이유, 감가상각을 버티는 가동률까지 인퍼런스의 경제학을 짚는다.
핵심 내용 읽기 →
카카오페이 팀이 네 개의 LLM 서빙 프레임워크를 직접 비교하고 실험한 과정을 공개했다. 최종적으로 vLLM을 고른 기준과, GPU 메모리 낭비를 줄이는 페이지드 어텐션·연속 배칭의 원리를 함께 설명한다.
핵심 내용 읽기 →
SGLang은 요청이 끝나도 KV 캐시를 버리지 않고 트리에 보관해 다른 요청이 재사용하게 만든 서빙 엔진이다. vLLM 대비 처리량 6.4배라는 수치와, 입력이 매번 달라지면 오히려 불리해지는 이유까지 정리했다.
핵심 내용 읽기 →