LoRA 파인튜닝과 PEFT 정리: LLM 미세조정 GPU 메모리 계산과 모델 병합 전략
AI 엔지니어링 7장 발표 정리. 풀 파인튜닝의 VRAM 계산부터 어댑터와 LoRA의 저랭크 분해, 태스크 벡터 기반 모델 병합, 학습률과 배치 크기 등 학습 하이퍼파라미터까지 실무 관점으로 짚었다.
핵심 내용 읽기 →AI TOPIC
GPU메모리 관련 핵심 뉴스와 활용 인사이트 5편을 최신순으로 모았습니다.

AI 엔지니어링 7장 발표 정리. 풀 파인튜닝의 VRAM 계산부터 어댑터와 LoRA의 저랭크 분해, 태스크 벡터 기반 모델 병합, 학습률과 배치 크기 등 학습 하이퍼파라미터까지 실무 관점으로 짚었다.
핵심 내용 읽기 →
vLLM은 인자를 제대로 잡지 않으면 속도 이점을 살리지 못한다. VRAM이 모자랄 때 줄여야 할 값과 여유가 있을 때 늘려야 할 값, 오프로딩과 접두 캐싱, 양자화 자동 감지까지 조정 순서대로 정리했다.
핵심 내용 읽기 →
라마 3.1 70B는 그냥 돌리면 약 140GB 메모리가 필요하다. 양자화가 이 숫자를 어떻게 줄이는지, 자주 뒤섞이는 숫자 형식과 양자화 방법, 파일 형식이 서로 어떻게 다른지, 그리고 정밀도를 낮출 때 실제로 치르는 대가는 무엇인지 정리했다.
핵심 내용 읽기 →
트랜스포머 언어 모델이 긴 텍스트를 생성할수록 GPU 메모리를 더 많이 쓰는 이유를 KV 캐시로 설명한다. 키·값 행렬을 저장해 매 단계의 재계산을 피하는 원리와 메모리 사용량 계산식, 그리고 300억 파라미터 모델 예시까지 정리했다.
핵심 내용 읽기 →
큰 배치는 학습을 안정시키지만 GPU 메모리에 한꺼번에 다 올리지 못할 때가 많다. 작은 마이크로배치의 경사를 합산해 큰 배치 효과를 내는 그래디언트 누적의 원리와 PyTorch 구현 순서를 정리했다.
핵심 내용 읽기 →