AI VIDEO BRIEFING

GRPO 쉽게 이해하기: PPO와 무엇이 다른가, 딥시크 R1의 강화학습 알고리즘 해설

딥시크 R1의 핵심 강화학습 알고리즘 GRPO를 소개한 DeepSeekMath 논문을 정리했다. PPO에서 가치 모델을 걷어내고 여러 응답을 묶어 상대 비교하는 방식이 어떤 이득을 주는지, 수학 말뭉치는 어떻게 만들었는지 살펴본다.

딥시크 R1을 만든 강화학습, GRPO는 무엇을 바꿨나 — DeepSeekMath 논문 해설 영상 대표 이미지

핵심 메시지

  • GRPO는 딥시크 R1을 학습시킨 강화학습 알고리즘으로, 2017년부터 쓰인 PPO를 토대로 만들어졌다.
  • 가장 큰 변화는 가치 모델을 완전히 제거한 것이다. 가치 모델은 보통 학습 대상 언어모델과 비슷한 크기여서 메모리와 연산 부담이 컸다.
  • GRPO는 하나의 질문에 여러 응답을 뽑고 그 보상들의 평균과 표준편차로 정규화해, 응답이 그룹 안에서 평균보다 나은지로 어드밴티지를 구한다.
  • DeepSeekMath는 수학 사전학습, 지시 튜닝, 강화학습 세 단계를 거쳤고, 일반 언어모델보다 코드 언어모델에서 출발하는 편이 더 좋은 결과를 냈다.
  • 수학 말뭉치는 분류기 학습과 웹 수집을 네 번 반복해 만들었고, 최종적으로 3,550만 개 웹페이지, 1,200억 토큰 규모가 되었다.

쉽게 이해하기

2024년 말 OpenAI가 o1 계열을 내놓으면서 긴 사고 사슬로 오래 '생각하는' 대형 추론 모델 경쟁이 시작됐다. 추론 시점에 연산을 더 써서 문제 해결력을 끌어올리는 테스트 타임 스케일링이 핵심이다. 2025년 초 딥시크가 이에 필적하는 R1을 오픈소스로 공개하고 학습 방법을 담은 논문까지 내놓으면서 판이 흔들렸고, 그 R1의 핵심 부품이 바로 GRPO다.

GRPO를 이해하려면 먼저 PPO를 봐야 한다. PPO에서는 학습 대상인 정책 모델 외에 세 개의 모델이 더 필요하다. 응답의 점수를 매기는 보상 모델, 평균적인 응답의 가치를 추정하는 가치 모델, 그리고 원본 모델에서 너무 멀어지지 않도록 KL 페널티를 계산하는 기준 모델이다. 이 셋을 조합해 '이 응답이 평균보다 얼마나 나은가'를 뜻하는 어드밴티지를 구한다.

GRPO는 이 중 가치 모델을 통째로 없앤다. 대신 같은 질문에 대해 응답을 여러 개(G개) 뽑고, 각 응답의 보상에서 평균을 빼고 표준편차로 나눠 정규화한다. 평균적인 가치를 별도 모델로 추정하는 대신 방금 뽑은 응답 그룹으로 추정하는 것이고, 이름에 붙은 '그룹 상대적'이 바로 이 뜻이다. 딥시크 R1에서는 보상 모델 대신 수학 답이 맞았는지 같은 규칙으로 보상을 계산했다.

목적 함수를 보면 두 알고리즘의 공통점도 보인다. 학습 단계 전후로 같은 응답의 확률이 얼마나 달라졌는지를 나타내는 정책 비율에 어드밴티지를 곱해 좋은 응답의 확률을 높인다. 여기에 클리핑을 걸어 한 번의 업데이트가 지나치게 커지지 않게 막는다. 작은 배치 하나가 모델을 급격히 흔들지 않도록 점진적으로 개선하려는 장치다.

논문은 GRPO를 쓰는 두 가지 방식도 제시한다. R1에 쓰인 결과 감독은 최종 답만 보상하고, 과정 감독은 추론 단계마다 보상해 어드밴티지가 추론의 어느 지점인지에도 좌우된다. 이 모든 과정을 거쳐 나온 DeepSeekMath 7B는 수학 벤치마크에서 훨씬 큰 모델들을 넘어, 당시 비공개 모델 수준까지 올라섰다.

주요 인사이트

  • GRPO의 이득은 정확도보다 자원에 가깝다. 학습 대상과 비슷한 크기의 가치 모델을 없앤 것만으로 메모리와 연산 부담, 그리고 그 모델을 따로 학습시키는 수고가 사라진다.
  • 보상은 응답 전체에 대해 하나만 주어지지만, 목적 함수는 응답의 토큰마다 합을 취한다. 모델이 토큰을 하나씩 생성하는 만큼 학습 신호도 토큰 단위로 전파돼야 하기 때문이다.
  • KL 페널티는 두 알고리즘 모두 쓰지만 위치가 다르다. PPO는 어드밴티지 안에 넣고, GRPO는 어드밴티지 밖으로 빼내 목적 함수에 따로 둔다.
  • 데이터 구축 과정도 눈여겨볼 만하다. 분류기로 웹 문서를 걸러 말뭉치를 늘리고, 수학 문서 비중이 10%를 넘는 도메인을 찾아 시드 데이터셋을 확장하는 반복 파이프라인을 네 번 돌렸다. 마지막 반복의 추가 수집분이 2%에 그치자 멈췄다.
  • 출발점 선택이 결과를 바꿨다. 연구진은 범용 언어모델에서 시작하는 방안도 시험했지만, 코드 특화 모델에서 출발했을 때 수학 성능이 더 좋았다.

자주 묻는 질문

GRPO와 PPO의 가장 큰 차이는 무엇인가요?

PPO가 평균적인 응답의 가치를 추정하기 위해 별도의 가치 모델을 두는 반면, GRPO는 그 모델을 제거하고 같은 질문에 대해 뽑은 여러 응답의 보상 평균과 표준편차로 대신합니다. 가치 모델은 보통 학습 대상 모델과 크기가 비슷해, 제거만으로도 메모리와 연산 부담이 크게 줄어듭니다.

어드밴티지는 왜 필요한가요?

보상만으로는 학습 신호가 충분히 강하지 않기 때문입니다. 어드밴티지는 해당 응답이 같은 질문에 대한 평균적인 응답보다 나은지 나쁜지를 알려 주고, 이 값이 양수인 응답의 확률을 높이도록 모델을 업데이트합니다.

결과 감독과 과정 감독은 어떻게 다른가요?

결과 감독은 최종 답만 보고 보상을 주며 딥시크 R1이 쓴 방식입니다. 과정 감독은 추론 단계마다 보상을 주기 때문에 어드밴티지가 추론 과정의 어느 지점에 있는지에도 영향을 받습니다.

DeepSeekMath의 수학 말뭉치는 어떻게 만들었나요?

OpenWebMath라는 소규모 고품질 데이터셋을 시드로 삼아 수학 분류기를 학습시키고, 그 분류기로 Common Crawl에서 수학 웹페이지를 모으고, 수학 문서가 10% 넘게 나오는 도메인을 찾아 시드를 확장하는 과정을 네 번 반복했습니다. 결과는 3,550만 개 웹페이지, 1,200억 토큰입니다.

원문과 출처

이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.

YouTube 원본 영상 보기 ↗

관련 AI 소식