AI VIDEO BRIEFING

젬마 3(Gemma 3) 한국어 성능 테스트: 4B 모델 지능·이미지·툴 호출 검증 결과

구글이 공개한 오픈소스 모델 젬마 3를 4B 크기로 직접 내려받아 한국어 추론, 이미지 판독, 도구 호출까지 세 가지를 시험한 기록이다. 노트북급 모델이 어디까지 쓸 만하고 어디서 막히는지, 실제 실행 결과를 근거로 정리했다.

젬마 3, 한국어는 얼마나 할까 — 4B 모델을 직접 돌려 본 세 가지 시험 영상 대표 이미지

핵심 메시지

  • 젬마 3는 1B·4B·12B·27B 네 가지 크기로 나와, 노트북부터 사내 온프레미스 서버까지 선택 폭이 넓어졌다.
  • 노트북급 4B 모델도 한국어 추론 질문에 정확히 답했고, 같은 시험에서 더 큰 큐원 7B 모델은 오답을 냈다.
  • 이미지 판독은 글자를 읽어 내기는 하지만 표의 의미를 잘못 해석해, OCR 대체용으로 쓰기에는 부족했다.
  • 함수 호출은 공식적으로 지원한다고 발표됐지만, 실행 환경(올라마)에서는 4B·12B 모두 도구 사용이 막혀 있었다.
  • 상업적 사용이 열린 한국어 오픈소스 모델 선택지가 사실상 구글 계열뿐이라는 점에서 의미가 크다.

쉽게 이해하기

구글이 오픈소스 모델 계열의 최신판인 젬마 3를 공개했다. 이번에는 1B·4B·12B·27B 네 가지 크기로 나와, 노트북에서 돌릴 만한 소형 모델과 사내 서버에 올릴 중형 모델을 함께 고를 수 있게 됐다. 이전 세대에서 90억 개 규모 모델만으로도 한국어가 제법 통했던 경험이 있어, 국내 사용자들의 기대가 특히 컸던 공개였다.

발표 자료가 내세운 변화는 세 가지다. 컨텍스트 창이 12만 8천 토큰으로 늘었고, 140개 언어를 지원하며, 텍스트뿐 아니라 이미지와 짧은 영상까지 다루는 멀티모달 모델로 나왔다. 양자화 버전을 구글이 직접 배포한 점도 달라진 부분으로, 개인이 변환한 버전보다 효율이 낫다고 설명한다. 인간 선호도 평가에서 라마 405B·딥시크 V3·o3 미니를 앞섰다는 수치도 함께 제시됐다.

실제 검증은 4B 모델을 내려받아 소비자용 그래픽카드(RTX 4070) 위에서 진행됐다. 첫 시험은 9.9와 9.11 중 어느 쪽이 큰지 묻는 고전적인 질문이었는데, 추론 과정을 따로 돌리지 않는 젬마 3 4B가 0.79 차이라는 정답을 곧바로 내놨다. 반면 두 배 가까이 큰 큐원 2.5 7B 모델은 근거를 길게 늘어놓고도 9.11이 더 크다는 오답을 냈다.

약점도 분명했다. 학습 데이터가 2024년 5월까지라 최신 모델 비교를 시키면 그 시점 기준으로 답하고, 젬마 3 자신에 대해서는 존재하지 않는 제품군 이름을 지어내는 환각을 보였다. 이미지 시험에서는 화질이 낮은 도식을 엉뚱하게 설명했고, 표 이미지에서는 글자 자체는 정확히 읽었지만 그 표가 무엇을 나타내는지는 잘못 짚었다. 도구 호출은 실행 환경에서 아예 지원되지 않아 4B와 12B 모두 오류가 났다.

정리하면 텍스트 작업에서는 노트북급 크기로도 유료 서비스에 근접한 한국어 답변을 내놓지만, 이미지 판독과 에이전트용 도구 연동은 아직 기다려야 한다는 결론이다. 상업적 라이선스가 열린 한국어 오픈소스 모델이 사실상 구글 계열뿐인 상황에서, 자신이 하려는 작업에 이 크기가 맞는지 직접 시험해 보는 편이 가장 빠른 판단법이다.

주요 인사이트

  • 모델 크기와 성능이 늘 비례하지는 않는다. 최신 4B가 이전 세대 7B를 추론 문제에서 이긴 사례는, 파라미터 수보다 학습 방식과 세대 차이가 체감 품질을 더 크게 좌우한다는 점을 보여 준다.
  • 같은 모델이라도 크기를 키우면 아는 지식의 최신성이 올라간다. 4B는 옛 정보를 꺼내지만 12B는 더 최근 모델을 언급했는데, 지식 검색용으로 쓸 때 크기를 고려해야 하는 이유다.
  • '멀티모달 지원'과 '실무에서 쓸 만한 이미지 인식'은 다른 이야기다. 글자를 읽는 것과 표의 구조·의미를 해석하는 것은 난이도가 크게 다르며, 후자는 여전히 부족했다.
  • 함수 호출은 모델 자체보다 실행 환경의 지원 여부가 발목을 잡을 수 있다. 발표 자료에 지원이라고 적혀 있어도 자신이 쓰는 런타임에서 되는지 따로 확인해야 한다.
  • 온프레미스 도입을 검토하는 조직에는 1B~12B 구간의 선택지가 늘어난 점 자체가 실익이다. 사내 서버 규모와 GPU 예산에 맞춰 타협점을 찾기 쉬워졌다.

자주 묻는 질문

젬마 3는 어떤 크기로 나왔나요?

1B, 4B, 12B, 27B 네 가지입니다. 1B·4B·12B는 노트북에서도 돌려 볼 만한 크기이고, 사내 온프레미스 서버를 구성해 쓰려는 경우에도 적절한 선택지가 생겼다는 평가입니다.

한국어 성능은 어느 정도였나요?

4B 모델로 시험했을 때 9.9와 9.11의 크기 비교 같은 문제를 추론 과정 없이도 정확히 맞혔고, 최신 모델들을 비교해 표로 정리해 달라는 요청에도 마크다운 표까지 만들어 답했습니다. 다만 학습 시점 이후 정보는 알지 못하고 환각도 나타났습니다.

이미지 인식은 실무에 쓸 만했나요?

표 안의 글자와 날짜는 정확히 읽어 냈지만, 그 표가 무엇을 나타내는 자료인지는 잘못 해석했습니다. 화질이 낮은 도식에서는 명칭 자체를 틀리게 읽기도 해, OCR 용도로 활용하기에는 부족하다는 결론이었습니다.

에이전트용 도구 호출은 되나요?

공개 자료에는 함수 호출을 지원한다고 적혀 있지만, 올라마를 통해 실행했을 때는 도구를 지원하지 않는다는 오류가 났습니다. 4B에서 12B로 크기를 올려도 마찬가지였고, 실행 환경 쪽 지원이 아직 붙지 않은 것으로 보인다는 설명입니다.

원문과 출처

이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.

YouTube 원본 영상 보기 ↗

관련 AI 소식