AI VIDEO BRIEFING
사이언티스트 AI: 에이전트 AI의 대안으로 제시된 안전 설계형 AI 아키텍처
로제로(LawZero)가 공개한 '사이언티스트 AI'는 기존 모델을 손보는 대신 지능과 행위주체성을 분리해 설계한다. 가설을 세우고 검증하는 구조와 그 근거를 정리했다.

핵심 메시지
쉽게 이해하기
로제로(LawZero)에서 연구와 제품을 총괄하는 발표자는 5분 남짓한 짧은 발표에서 자신들이 만들고 있는 '사이언티스트 AI'를 소개했다. 출발점은 AI 정렬과 안전에 대한 문제의식이다. 그는 지금 당장 드러나는 아첨(sycophancy)과 보상 해킹, 맥락 해킹 같은 문제는 물론이고, 자기보존이나 기만적 계략처럼 더 긴 시간축의 위험까지 함께 우려한다고 말했다.
그가 강조한 진단은 방법론에 관한 것이다. 이미 만들어진 모델을 덧대어 고치거나 방향을 조종하는 방식으로는 문제가 계속 생길 수밖에 없다는 것이다. 그래서 근본적으로 다른 접근이 필요하고, 그 답으로 내놓은 것이 사이언티스트 AI다. 인간의 자아와 감정, 욕망에서 벗어나 오직 세계를 이해하고 추론하려는 이상적인 과학자를 상상하고, 그런 존재를 시스템으로 구현해보자는 발상이다.
설계의 첫 번째 전제는 지능과 행위주체성을 분리할 수 있다는 가정이다. 발표자는 행위주체성 안에 지능과 목표지향성, 그리고 실제로 무언가를 할 수 있는 수단이 함께 들어 있다고 보고, 뒤의 두 가지를 최소화하면서 추론하고 미래 상태를 따져보는 능력만 남길 수 있다면 통제되지 않는 행위주체성의 부작용을 피할 수 있다고 설명했다.
두 번째 전제는 과학 활동 자체를 본뜬 것이다. 좋은 과학자는 반증 가능한 가설을 세운다는 칼 포퍼의 관점을 따라, 시스템이 세계에 대한 가설을 만들고 그에 대한 찬반 증거를 모아 틀린 가설을 기각하도록 했다. 구조상으로는 세계가 어떻게 변하는지, 미래 상태가 어떠할지에 대한 가설과 인과적 설명을 만들어내는 '설명기'와, 그 가설들을 평가해 베이즈 방식으로 가중치를 매기고 가장 그럴듯한 것을 고르는 '예측기'가 따로 존재한다. 대규모 언어모델의 구성 요소를 여럿 빌려 쓰지만 같은 종류의 시스템은 아니라고 그는 선을 그었다.
세 번째 전제는 사실과 의견의 분리다. 웹에는 의견이 넘치고 사실은 드물기 때문에, 시스템은 '누군가가 커뮤니티에 어떤 주장을 썼다'는 진술과 '그 주장이 실제로 참인가'라는 반증 가능한 가설을 구분해서 다뤄야 한다는 것이다. 그런 데이터를 그대로 다음 토큰 예측으로 학습시켜 그 태도까지 재현하게 만드는 것은 피해야 한다는 지적이다. 발표자는 이런 구조에서 모델이 더 유능해질수록 오히려 더 정직해지는 성질을 확인한 논문을 일주일 전 공개했다고 덧붙였다.
주요 인사이트
- 위험을 줄이는 방법을 사후 통제가 아니라 아키텍처 단계에서 찾는다는 점이 이 접근의 핵심이다. 발표자는 이를 '설계에 의한 안전(safe by design)'이라고 표현했다.
- 지능과 행위주체성을 분리한다는 가정은 검증되지 않은 큰 전제이며, 발표자 스스로도 시간 관계상 세부 논증을 생략했다고 밝혔다. 이 가정이 성립하는지가 이 계획 전체의 성패를 가른다.
- 능력이 커질수록 위험도 커진다는 통념과 달리, 능력 향상과 정직성이 함께 가도록 만드는 것을 목표로 삼았다는 점이 눈에 띈다.
- 가설 생성과 가설 평가를 별도 구성 요소로 나눈 설계는, 결과물을 감사하고 검증할 수 있게 만드는 실용적 장치이기도 하다.
- 웹 데이터에서 발화와 사실을 구분하지 않고 학습하는 관행에 대한 문제 제기는, 안전 문제를 데이터 처리 단계의 과제로 되돌려 놓는다.
자주 묻는 질문
사이언티스트 AI는 기존 대규모 언어모델과 어떻게 다른가?
발표자는 구성 요소를 여럿 빌려 쓰지만 다른 종류의 시스템이라고 설명했다. 가설과 인과적 설명을 만드는 설명기와 그 가설을 베이즈 방식으로 평가하는 예측기가 분리되어 있고, 데이터를 나누는 맥락화 계층이 앞단에 놓인다.
왜 기존 모델을 개선하는 방식으로는 부족하다고 보는가?
이미 만들어진 모델에 패치를 덧대거나 방향을 조종하는 방식은 계속 문제를 일으킬 것이라는 판단 때문이다. 그래서 근본적으로 다른 설계가 필요하다는 것이 발표의 전제다.
'사실과 의견의 분리'는 구체적으로 무엇을 뜻하나?
누가 어떤 주장을 했다는 진술과, 그 주장이 실제로 참인지에 대한 반증 가능한 가설을 서로 다른 것으로 다룬다는 뜻이다. 발표자는 그런 구분 없이 다음 토큰 예측으로 학습시키면 그 태도까지 따라 하게 된다고 지적했다.
이 시스템이 내놓는 결과물의 특징은 무엇인가?
발표자는 감사할 수 있고 검증할 수 있으며 이해관계가 개입되지 않은 출력을 목표로 한다고 요약했다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗