AI VIDEO BRIEFING

Gemma 2 2B와 9B의 KL 발산 비교, 닐 난다가 보여준 해석성 탐색 연구 과정

닐 난다가 Gemma 2 2B와 9B의 토큰별 KL 발산을 비교하며 두 모델이 갈리는 지점을 찾는 과정을 실시간으로 공개했다. 탐색 단계 연구에서 무엇을 노려야 하는지, 코딩을 모델에 맡기는 방식의 득실은 무엇인지가 함께 드러난다.

같은 계열의 큰 모델은 무엇을 더 아는가 — 닐 난다의 실시간 해석성 연구 영상 대표 이미지

핵심 메시지

  • 같은 텍스트를 Gemma 2 2B와 9B에 넣고 토큰별 KL 발산을 비교해 두 모델이 실제로 갈리는 지점을 찾는 방식이다.
  • 코드는 대부분 커서(Cursor)에 지시해 쓰게 했지만, 결과는 매번 직접 눈으로 확인하며 진행했다.
  • 난다는 연구를 탐색·정제·소통 세 단계로 나누고, 탐색 단계의 목표는 문제에 대한 '표면적'을 넓히는 것이라고 설명한다.
  • 표본 안에서 성능 차이의 상당 부분은 큰 모델만 알고 있는 사실과 문자열 기억에서 나왔다.
  • 가장 인상적인 사례는 언어 식별로, 9B는 문장이 노르웨이어임을 파악해 이어 썼지만 2B는 그러지 못했다.

쉽게 이해하기

이 영상은 닐 난다가 MATS 8.0 스콜라들과 함께 진행한 연구 세션을 그대로 담았다. 질문은 단순하다. 같은 계열의 크기가 다른 두 모델이 갈리는 지점에 해석 가능한 구조가 존재하는가, 그리고 그 차이는 몇몇 토큰에 몰려 있는가 아니면 전반에 옅게 퍼져 있는가. 난다는 큰 모델이 작은 모델보다 모든 것을 조금씩 더 정교하게 하는 쪽일 수도 있고, 대부분은 비슷하되 몇몇 토큰에서만 크게 앞서는 쪽일 수도 있다고 두 가설을 세운다.

실험 설계는 간명하다. 파일(pile) 데이터셋의 앞부분 1만 건에서 문서마다 앞 500 토큰을 잘라 두 모델에 넣고, 토큰마다 KL 발산과 정답 토큰에 대한 각 모델의 로그 확률을 데이터프레임에 저장한다. 앞뒤 다섯 토큰의 문맥도 함께 넣어 나중에 눈으로 읽을 수 있게 했다. 패딩 처리를 피하려고 500 토큰이 안 되는 문서는 아예 제외했다.

코딩은 거의 전부 커서에 맡겼고, 그 과정 자체가 이 세션의 또 다른 관전 포인트다. 모델은 파일 데이터셋 전체 600기가바이트를 내려받으려 하거나, 캐시를 통째로 저장해놓고 정작 쓰지 않는 코드를 만들어 냈다. 반대로 플롯 라이브러리를 다루거나 축을 바꾸고 리팩터링하는 작업에서는 확실히 빨랐다. 난다는 여기서 색상 스케일을 고를 때 0이 어디인지 의도적으로 정하라는 조언을 덧붙인다. 0을 흰색에 두자 어느 쪽 모델이 앞섰는지가 한눈에 드러났다.

정량 분석에서는 히스토그램과 누적합, 2차원 히트맵을 차례로 그렸다. 로그 확률 차이의 절댓값이 1보다 작은 지점들을 모두 합쳐도 전체 차이의 33% 정도만 설명된다는 결과가 나왔고, 이는 큰 값들이 상당한 비중을 차지한다는 뜻이다. 히트맵에서는 큰 모델이 확신하고 작은 모델이 헤매는 영역이 그 반대 영역보다 훨씬 두터웠다. 다만 난다는 표본이 작다는 점과, KL 발산이 원래 불확실한 고엔트로피 자리를 부풀릴 수 있다는 점을 스스로 지적한다.

마지막 30분은 개별 사례 찾기다. 정답 토큰이 9B에서는 1순위인데 2B에서는 50위 밖인 자리만 걸러 보니, 도커 명령의 출력 형식, 크로미움 관련 용어, 특정 인명 같은 기억 항목이 줄줄이 나왔다. 그중 하나는 노르웨이어 문장이었고, 9B는 언어를 알아채고 그럴듯하게 이어 쓴 반면 2B는 실패했다. 난다는 이것만은 단순 암기가 아니라 일반화 가능한 회로로 보인다고 평가하면서, 자신이 쓴 필터가 객관식 추론 같은 능력 차이는 애초에 걸러내지 못한다는 한계도 함께 밝힌다.

주요 인사이트

  • KL 발산 기반 지표는 원래 예측이 불확실한 토큰을 함께 강조하므로, 큰 값이 곧 흥미로운 차이를 뜻하지는 않는다.
  • 로그 확률 차이가 커지는 이유는 작은 모델이 크게 틀렸거나 큰 모델이 크게 맞았거나 둘 중 하나인데, 겉으로는 구분되지 않는다.
  • '큰 모델은 1순위, 작은 모델은 50위 밖'처럼 과감한 필터는 놓치는 사례가 많아도 흥미로운 예시를 빠르게 건지는 데는 효율적이다.
  • 언어 식별처럼 문맥 초반에 작동하는 회로는 모델 크기를 키웠을 때 이득이 특히 크게 나타날 수 있다.
  • 코딩 에이전트에게 라이브러리 문서 주소를 알려주면 학습되지 않은 API도 다루게 만들 수 있다.

자주 묻는 질문

KL 발산으로 두 모델을 비교하면 무엇을 알 수 있나요?

같은 문맥에서 다음 토큰 확률 분포가 얼마나 다른지를 토큰 단위로 볼 수 있어, 두 모델이 실제로 갈리는 자리를 찾아낼 수 있습니다. 다만 원래 예측이 불확실한 자리에서도 값이 커질 수 있다는 한계가 있습니다.

큰 모델의 성능 향상은 주로 어디서 오나요?

이 세션의 표본에서는 도커 출력이나 인명처럼 작은 모델이 전혀 모르는 사실 기억, 그리고 언어 식별에서 큰 차이가 났습니다. 다만 난다는 표본이 작고 필터가 한쪽으로 치우쳐 있어 일반화하기에는 이르다고 덧붙였습니다.

코딩을 모델에 맡긴 방식은 연구에 도움이 됐나요?

플롯을 그리고 코드를 고쳐 쓰는 반복 작업은 확실히 빨라졌습니다. 반면 데이터셋을 잘못 내려받거나 쓰지도 않는 캐시를 저장하는 등 되돌리는 데 쓴 시간도 적지 않았습니다.

원문과 출처

이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.

YouTube 원본 영상 보기 ↗

관련 AI 소식

#해석성 연구#언어모델#모델 크기#KL 발산#AI 연구 방법