인퍼런스 시대의 토큰 팩토리, prefill·decode 분리와 투기적 디코딩이 바꾸는 GPU 경제학
자체 GPU 데이터센터를 지은 국내 AI 스타트업을 찾아간 팟캐스트를 정리했다. 초당 1,000토큰이 나오는 원리부터 prefill과 decode를 분리하는 이유, 감가상각을 버티는 가동률까지 인퍼런스의 경제학을 짚는다.
핵심 내용 읽기 →AI TOPIC
투기적 디코딩 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

자체 GPU 데이터센터를 지은 국내 AI 스타트업을 찾아간 팟캐스트를 정리했다. 초당 1,000토큰이 나오는 원리부터 prefill과 decode를 분리하는 이유, 감가상각을 버티는 가동률까지 인퍼런스의 경제학을 짚는다.
핵심 내용 읽기 →
작은 드래프트 모델이 고른 후보 토큰만 살펴 조기 종료 판단 비용을 줄인 SpecEE 논문 리뷰. 라마2 7B에서 클라우드 2.25배, PC 2.43배 속도를 얻은 세 가지 최적화와 정확도 손실을 정리했다.
핵심 내용 읽기 →
딥시크가 공개한 DSpark는 초안 모델과 검증 모델을 짝지어 여러 토큰을 한 번에 처리하는 투기적 디코딩을 개선해, 자체 모델 기준 응답 속도를 60~85% 높였다.
핵심 내용 읽기 →