AI VIDEO BRIEFING
GPU 작동 원리 완전 정리: CUDA 코어와 텐서 코어, AI 연산이 빨라지는 진짜 이유
GPU와 CPU의 차이를 주방에 비유해 풀어낸 해설. CUDA 코어와 텐서 코어의 역할, 메모리 대역폭이 진짜 병목인 이유, 게임 렌더링과 AI 학습이 같은 수학 문제인 이유, 엔비디아 CUDA 생태계의 힘까지 정리했다.

핵심 메시지
쉽게 이해하기
영상은 두 개의 주방으로 이야기를 연다. 한쪽은 유명 셰프가 30명분 코스 요리를 머릿속으로 조율하며 예약자의 알레르기까지 기억하는 레스토랑이고, 다른 쪽은 하프타임에 8만 명을 먹여야 하는 경기장 주방이다. 후자에는 총괄 셰프가 없고, 똑같은 동작을 반복하는 4,000명의 라인 쿡만 있다. 발표자는 전자를 CPU, 후자를 GPU에 대응시킨다.
CPU 쪽 요리사는 스물몇 명뿐이지만 즉흥 대응이 가능하다. 운영체제를 부팅하고 설정 파일을 파싱하고 웹 서버를 돌리는 일, 분기 로직을 처리하는 일이 여기에 해당한다. 반면 GPU의 1만여 코어가 아는 것은 사실상 한 가지, 두 수를 곱하고 세 번째 수를 더하는 FMA 연산뿐이다. 대신 서로 의존하지 않는 계산 더미를 던져주면 압도적인 속도로 밀어낸다.
칩 내부는 프랜차이즈처럼 같은 구조가 반복된다. GA102 칩은 7개의 그래픽 처리 클러스터로 나뉘고, 각 클러스터 안에 12개의 스트리밍 멀티프로세서가, 그 안에 32개 스레드가 한 묶음으로 움직이는 워프가 있다. 이 반복 구조 덕분에 제조 결함이 생겨도 문제가 난 구역만 비활성화하고 하위 등급 제품으로 출하할 수 있다. 결함 16곳을 끈 칩이 상위 모델 대신 하위 모델로 팔리는 식이다.
코어가 아무리 많아도 재료가 늦게 도착하면 소용이 없다. 그래서 그래픽카드는 칩 옆에 전용 메모리를 두고 384비트 버스로 초당 1.15테라바이트를 실어 나른다. CPU가 쓰는 64비트 버스 대비 약 18배다. AI 전용 칩에서는 여기서 더 나아가, 실리콘 관통 배선으로 메모리를 칩 위에 수직으로 쌓는 HBM3를 써서 초당 3.35테라바이트까지 끌어올렸다.
GPU가 게임과 AI 양쪽에서 강한 이유는 두 작업의 성질이 같기 때문이다. 장면 하나에 담긴 수백만 개의 정점을 좌표 공간으로 옮기는 계산은 서로를 전혀 참조하지 않는다. 신경망 한 층에서 입력에 가중치를 곱하고 편향을 더하는 계산도 마찬가지다. 컴퓨터 과학에서는 이런 문제를 '민망할 정도로 병렬적(embarrassingly parallel)'이라고 부른다.
주요 인사이트
- 텐서 코어는 값 하나씩이 아니라 행렬 전체를 한 클록에 곱하고 더한다. 신경망 층 연산이 곧 행렬 곱이기 때문에, H100 한 장의 텐서 코어 640개가 초당 2,000조 회에 육박하는 연산을 낸다는 사실이 대형 모델 학습을 물리적으로 가능하게 만든 조건이다.
- 학습과 추론은 같은 주방의 다른 운영 모드다. 학습은 오차를 거꾸로 흘려보내 가중치를 조정하는 역전파가 순전파의 약 두 배 연산을 잡아먹는 비싼 모드이고, 추론은 역전파가 없지만 토큰 하나마다 수백 번의 행렬 곱이 반복된다.
- GPT-3 학습에는 대략 355 GPU-년에 해당하는 연산이 들었고, 수천 장을 동시에 돌려 몇 주로 압축했다는 설명은 '규모의 문제'가 곧 '병렬화의 문제'임을 보여준다.
- 제조 결함을 등급 분리로 흡수하는 설계는 공학적 판단인 동시에 사업적 판단이다. 반복 구조가 수율 손실을 제품 라인업으로 바꿔놓는다.
- 파이토치나 텐서플로 코드는 GPU를 직접 제어하지 않는다. 그 아래 CUDA가 고수준 행렬 연산을 코어별 명령 시퀀스로 번역하며, 이 소프트웨어 층의 축적이 하드웨어 성능만큼이나 큰 진입 장벽이다.
자주 묻는 질문
CPU와 GPU 중 어느 쪽이 더 빠른가요?
영상은 그 질문 자체가 잘못됐다고 말합니다. 운영체제 구동, 네트워크 요청 처리, 분기 로직처럼 복잡하고 순차적인 일은 CPU가 맞고, 동일한 수학을 수백만 개 데이터에 한꺼번에 적용하는 일은 GPU가 압도적입니다. 무엇을 하려는지가 답을 정합니다.
대형 AI 모델에서 메모리가 왜 병목이 되나요?
GPT-3는 파라미터가 1,750억 개여서 가중치만 담는 데도 350GB가 필요한데, 엔비디아 H100 한 장의 메모리는 80GB입니다. 모델이 카드 한 장에 들어가지 않고, 순전파 때마다 모든 가중치를 메모리로 흘려보내야 해서 연산보다 데이터 공급이 더 어려운 문제가 됩니다.
게임 렌더링과 AI 연산이 비슷하다는 말은 무슨 뜻인가요?
게임에서는 수백만 개 정점을 같은 방식으로 좌표 변환하고, 신경망에서는 각 뉴런이 입력에 가중치를 곱해 결과를 냅니다. 두 경우 모두 개별 계산이 다른 계산의 결과를 기다리지 않기 때문에, 코어 수천 개에 그대로 나눠 던질 수 있다는 점에서 같은 유형의 문제입니다.
CUDA가 왜 중요한가요?
파이토치나 텐서플로로 작성한 고수준 코드를 GPU 코어가 이해하는 명령으로 바꿔주는 소프트웨어 층이 CUDA입니다. 10년 넘게 쌓인 이 생태계 덕분에 엔비디아는 칩 성능만이 아니라 개발 스택 전체에서 우위를 갖는다고 영상은 설명합니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗