AI 추론 비용 경쟁: 프리필·디코드 분리와 KV 캐시가 좌우하는 서빙 효율, 발표 수치 읽는 법
오픈AI와 AMD·세레브라스가 한 달 사이 내놓은 발표는 새 칩 없이 추론 비용을 낮추는 방법을 보여준다. 프리필과 디코드를 나누는 구조, KV 캐시 이동 속도, 발표 수치를 어디까지 믿어야 하는지 정리했다.
핵심 내용 읽기 →AI TOPIC
세레브라스 관련 핵심 뉴스와 활용 인사이트 5편을 최신순으로 모았습니다.

오픈AI와 AMD·세레브라스가 한 달 사이 내놓은 발표는 새 칩 없이 추론 비용을 낮추는 방법을 보여준다. 프리필과 디코드를 나누는 구조, KV 캐시 이동 속도, 발표 수치를 어디까지 믿어야 하는지 정리했다.
핵심 내용 읽기 →
세레브라스 창업자 앤드루 펠드먼이 No Priors에 나와 접시 크기 칩을 만들기까지 겪은 2년의 실패, 아무도 찾지 않던 시장보다 앞선 3년, 4주 반 만에 성사된 200억 달러대 OpenAI 계약을 이야기했다.
핵심 내용 읽기 →
세레브라스 공동창업자 앤드루 펠드먼이 추론 속도가 왜 AI의 핵심 지표가 됐는지, GPU가 빠른 추론에 약한 이유, 반도체 3대 병목과 웨이퍼 스케일 칩 전략, CUDA 해자의 축소를 설명합니다.
핵심 내용 읽기 →
대형 언어모델의 응답 속도는 왜 초당 40~60토큰에 머물까. 세레브라스 같은 전용 칩으로 18배 빠르게 서빙할 때 드는 비용과, 그 속도가 사업적으로 말이 되는 이유를 짚어본다.
핵심 내용 읽기 →
OpenAI가 GPT 5.6을 Saul·Terra·Luna 3종으로 정리했다. 영상이 짚는 토큰 가격 구조, 중국 모델의 추격, 정부 규제, 그리고 칩·인프라 경쟁을 정리했다.
핵심 내용 읽기 →