GPU 활용률 끌어올리는 스케줄링: 서울대 서지원 교수의 딥러닝 학습·LLM 추론 최적화 강연
서울대 AI 콜로퀴움에서 서지원 교수가 딥러닝 학습과 LLM 추론의 GPU 저활용 문제를 해부했다. 역전파 순서를 바꾸는 아웃오브오더 백프롭과, 토큰 지연시간 제약을 지키며 처리량을 최대화하는 추론 스케줄링을 소개한다.
핵심 내용 읽기 →AI TOPIC
스케줄링 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

서울대 AI 콜로퀴움에서 서지원 교수가 딥러닝 학습과 LLM 추론의 GPU 저활용 문제를 해부했다. 역전파 순서를 바꾸는 아웃오브오더 백프롭과, 토큰 지연시간 제약을 지키며 처리량을 최대화하는 추론 스케줄링을 소개한다.
핵심 내용 읽기 →
긴 응답을 만드는 요청이 디코더를 붙잡으면 짧은 요청은 계속 기다린다. 파이토치 콘퍼런스 발표가 소개한 토큰 슬라이스는 운영체제 스케줄링의 시분할 아이디어를 LLM 추론에 옮긴 시도이며, 그 대가로 캐시 재계산 비용을 감수해야 한다.
핵심 내용 읽기 →