AI VIDEO BRIEFING
연속 사고 기계(CTM) 쉽게 정리: 사카나AI가 트랜스포머 대신 시간을 넣은 이유
사카나AI의 연속 사고 기계(CTM) 논문 해설. 입력과 분리된 내부 시간축, 뉴런마다 붙은 작은 신경망, 뉴런 동기화로 만드는 잠재 표현, 확신도에 따라 사고를 멈추는 적응형 연산과 미로 실험 결과를 정리했다.

핵심 메시지
쉽게 이해하기
사람은 생각을 단번에 끝내지 않고 되짚고 다듬는다. 반면 대부분의 신경망은 거의 즉시 답을 낸다. 대형 언어모델은 긴 사고 사슬로 이 점진적 사고를 흉내 내지만, 사카나AI가 내놓은 연속 사고 기계는 아예 구조 안에 시간을 넣자고 제안한다. 논문 저자 중에는 트랜스포머를 만든 '어텐션이 전부다' 논문의 공저자 리온 존스(Llion Jones)도 포함돼 있다.
CTM은 순환 모델이지만, 흔한 순환 신경망처럼 입력 시퀀스를 차례로 처리하며 반복하지 않는다. 반복을 이끄는 것은 데이터와 분리된 내부 시간축이고, 그 한 걸음 한 걸음이 내부 틱이다. 인코더는 외부의 사전학습 구성요소로 두고, 그 특징 위에서 모델이 사고를 펼친다.
한 틱 안의 흐름은 이렇다. 연구진이 여러 선택지를 실험한 끝에 U-Net 계열 구조로 정한 '시냅스' 구성요소가 인코딩된 입력과 직전 틱의 출력을 함께 받아 사전활성화를 만든다. 그다음 잠재 공간 차원 수만큼 존재하는 '뉴런 수준 모델'들이 각자 자기 차원의 과거 사전활성화 이력을 읽고 값 하나씩을 내놓아 사후활성화를 만든다. 이력 길이는 10에서 100 사이가 잘 맞는다고 논문은 말한다.
다음 구성요소는 뉴런 동기화다. 모든 과거 틱의 사후활성화를 모은 행렬에 자기 전치를 곱해 뉴런 i와 j가 시간에 걸쳐 얼마나 함께 움직였는지를 담은 D×D 행렬을 만든다. 최근 신호에 더 큰 비중을 주는 학습 가능한 감쇠 항이 들어가며, 이 행렬 전체가 아니라 일부 셀만 무작위로 뽑아 잠재 표현으로 쓴다. 이 표현은 어텐션 블록의 입력이자 최종 출력을 만드는 선형 투영의 입력이 된다.
검증은 아직 초기 단계다. 대규모로 평가되지는 않았고 이 구조가 주류가 될지는 시간이 말해 줄 문제라고 영상은 선을 긋는다. 다만 39×39 크기, 경로 길이 100까지의 미로로 학습한 모델이 더 긴 경로와 더 큰 미로로 일반화했고, 여러 버전의 LSTM 기준선과 비교했을 때 긴 경로 미로를 꾸준히 푼 것은 CTM뿐이었다.
주요 인사이트
- 여기서 '뉴런'은 기존 신경망의 뉴런과 다른 추상화다. 시냅스 부분이 뉴런 사이의 상호작용을 담당하고, 뉴런 수준 모델이 시간에 따른 변화를 담당하도록 역할이 나뉘어 있다.
- 동기화 행렬의 크기는 잠재 공간 차원에만 달려 있고 지나온 내부 틱 수와 무관하다. 그래서 오래 생각해도 표현의 크기가 부풀지 않는다.
- 최종 답을 고르는 방식은 과제마다 다르다. 모든 틱의 출력을 평균 내거나, 마지막 틱을 쓰거나, 엔트로피로 잰 확신도가 가장 높았던 틱을 고르는 전략이 각각 다른 과제에서 잘 통했다.
- 학습 손실은 손실이 가장 낮았던 틱과 확신도가 가장 높았던 틱, 두 지점에서 평균을 낸다. 좋은 답을 내는 법뿐 아니라 언제 생각을 멈춰도 되는지까지 함께 배우게 하는 설계다.
- 초기 틱에는 참고할 이력이 없다는 문제는 첫 사후활성화 벡터와 초기 사전활성화 이력을 학습 가능한 파라미터로 두어 해결한다.
자주 묻는 질문
CTM의 '내부 틱'은 무엇인가요?
입력 데이터의 순서와 분리된 모델 내부의 시간 단위입니다. 모델은 1부터 t까지 이 틱을 밟아 가며 사고를 점진적으로 펼치고, 각 틱마다 출력을 하나씩 만들어 냅니다.
적응형 연산은 어떻게 가능해지나요?
출력마다 엔트로피로 확신도를 계산할 수 있어, 추론 시 정해진 횟수를 다 채우지 않고 확신이 서면 멈출 수 있습니다. 쉬운 입력은 빠르게 끝내고 복잡한 입력에는 더 많은 사고 시간을 쓰는 방식입니다.
성능은 검증됐나요?
아직 아주 큰 규모에서 평가되지는 않았습니다. 미로 풀이 실험에서 학습 때보다 긴 경로와 큰 미로로 일반화했고 LSTM 기준선보다 긴 경로에서 꾸준히 성공했지만, 이 구조가 주류가 될지는 더 지켜봐야 한다고 영상은 말합니다.
원문과 출처
이 글은 원본 영상의 자막을 바탕으로 한국어 독자를 위해 요약했습니다. 전체 맥락과 최신 정보는 원문에서 확인하세요.
YouTube 원본 영상 보기 ↗