AI VIDEO BRIEFING
쓰라린 교훈과 LLM: 강화학습이 AI의 다음 돌파구일까
1971년 음성인식 하피부터 알파고, 그리고 서턴의 '쓰라린 교훈'까지. 거대언어모델이 인간 지식에 지나치게 기댄 반례인지 짚어본다.

핵심 메시지
쉽게 이해하기
1971년 미국 ARPA는 5년 안에 단어 1,000개를 90% 정확도로 인식하는 음성 시스템을 목표로 프로그램을 시작했다. 카네기멜런 팀이 만든 하피(Harpy)는 이 목표를 넘어섰지만, 그 지능의 핵심은 1만 4,000개가 넘는 노드로 이뤄진 거대한 지식 그래프였다. 언어 전문가가 문법을 정의하고 각 단어를 음소로 쪼갠 뒤, 발음 변형과 단어 연결(juncture) 규칙까지 사람이 손으로 설계한 구조였다.
그러나 하피 방식은 더 큰 어휘로 확장하기 어려웠다. 1980년대 후반부터 음성인식은 데이터에서 확률을 학습하는 은닉 마르코프 모델로 넘어갔고, 사람이 문법과 발음 규칙을 지정하지 않고도 5,000단어, 2만 단어로 규모를 키울 수 있었다. 당시엔 인간 지식을 시스템에 심는 것이 중요하다고 믿는 연구자가 많아 논쟁적인 전환이었다.
서턴은 2019년 에세이 '쓰라린 교훈'에서 이 흐름을 70년 AI 연구의 가장 큰 교훈으로 정리했다. 계산을 활용하는 일반적 방법이 결국 가장 효과적이며, 인간의 지식을 심는 방식은 초기엔 도움이 되지만 이후 오히려 발목을 잡는다는 것이다. 공교롭게도 이 글은 GPT-2 공개 직후 나왔고, 트랜스포머와 다음 토큰 예측이라는 새 패러다임이 막 떠오르던 시점이었다.
반전은 2025년에 일어났다. 서턴은 드와케시 파텔과의 팟캐스트에서 LLM이 인간이 생성한 텍스트를 모방하도록 학습되기 때문에, 하피처럼 인간 지식에 지나치게 의존하는 '쓰라린 교훈의 부정적 사례'일 수 있다고 말했다. 많은 이들이 LLM 스케일업을 '쓰라린 교훈의 실천'으로 해석해 왔는데, 정작 에세이 저자는 정반대로 본 것이다.
영상은 그 대안으로 강화학습을 제시한다. 알파고는 인간 기보를 모방한 지도학습 정책망(아마추어 중급 수준)에서 출발했지만, 자기 자신과 대국하며 승부 결과를 신호로 삼는 정책 경사법과 승률을 추정하는 가치망, 그리고 몬테카를로 트리 탐색을 결합해 초인적 기사가 됐다. 이듬해의 알파고 제로는 인간 기보를 전혀 쓰지 않고도 더 강해졌다. LLM에도 RLHF와 검증 가능한 보상을 쓰는 RLVR가 이미 쓰이지만, 이 방향이 어디까지 갈지는 아직 미지수다.
주요 인사이트
- 하피의 지식 그래프가 은닉 마르코프 모델로 대체된 사건은, 손으로 짠 규칙이 데이터 기반 학습에 밀려나는 AI 역사의 반복되는 패턴을 보여준다.
- '쓰라린 교훈'의 핵심은 계산량 확장성이며, 인간 지식 주입은 초반의 지름길일 뿐 장기적으로는 발견 능력을 제약한다는 것이다.
- 서턴 본인이 LLM을 '쓰라린 교훈의 반례'로 본다는 점은, 스케일업이 곧 서턴 노선이라는 업계의 통념을 뒤집는 지점이다.
- 알파고 제로가 인간 기보 없이 더 강해진 사례는 '모방'을 넘어선 '경험으로부터의 발견'이 가능함을 보여주는 강력한 근거다.
- 다만 강화학습이 잘 통한 영역은 게임·수학 증명·코딩처럼 보상이 명확한 곳으로, 현실의 복잡한 문제로의 확장은 아직 열린 질문이다.
자주 묻는 질문
'쓰라린 교훈(The Bitter Lesson)'이란 무엇인가요?
리처드 서턴이 2019년에 쓴 에세이로, AI 역사 70년의 가장 큰 교훈은 인간 지식을 시스템에 심기보다 계산량을 활용하는 일반적 방법이 결국 압도적으로 효과적이라는 것입니다.
서턴은 왜 거대언어모델을 '쓰라린 교훈'의 반례로 보나요?
LLM이 인간이 만든 텍스트를 모방하도록 학습되기 때문입니다. 계산을 대규모로 쓰긴 하지만 인간 지식에 크게 의존하므로, 경험에서 스스로 배우는 시스템에 결국 추월당할 수 있다고 봅니다.
알파고와 거대언어모델의 학습은 어떻게 다른가요?
둘 다 처음엔 인간 데이터로 지도학습을 하지만, 알파고는 이후 실제 대국의 승패를 신호로 강화학습해 스스로 수를 발견합니다. 알파고 제로는 인간 기보를 아예 쓰지 않고도 더 강해졌습니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗