LLaDA 확산 언어모델 해설: 자기회귀를 벗어난 생성 방식과 역방향 추론 성능 비교
지금의 대형 언어모델은 앞에서부터 한 단어씩 이어 쓰는 자기회귀 방식이다. LLaDA는 이미지 생성에 쓰이던 확산 모델을 언어로 옮겨, 가려 둔 토큰을 여러 번에 걸쳐 벗겨 내며 문장을 완성하는 대안을 제시한다.
핵심 내용 읽기 →AI TOPIC
AI 논문 관련 핵심 뉴스와 활용 인사이트 9편을 최신순으로 모았습니다.

지금의 대형 언어모델은 앞에서부터 한 단어씩 이어 쓰는 자기회귀 방식이다. LLaDA는 이미지 생성에 쓰이던 확산 모델을 언어로 옮겨, 가려 둔 토큰을 여러 번에 걸쳐 벗겨 내며 문장을 완성하는 대안을 제시한다.
핵심 내용 읽기 →
거대 언어모델이 헤매는 스도쿠와 미로 문제를 2,700만 파라미터 모델이 예제 1,000개만으로 풀어낸다. 파라미터 대신 깊이를 사는 상위·하위 순환 모듈 구조와 학습 기법까지 계층적 추론 모델(HRM)의 원리를 정리했다.
핵심 내용 읽기 →
프롬프트에 전문가 역할을 넣은 답과 넣지 않은 답 1,140건을 비교하니 총점 차이는 0.008에 그쳤다. 전문성 깊이는 올랐지만 명료성이 더 크게 떨어졌고, 조언형과 개념형 질문에서 순위가 뒤집혔다.
핵심 내용 읽기 →
확산 트랜스포머에 사전학습 모델의 표현을 따라가게 하는 손실 항 하나를 더한 REPA 기법이 학습 속도와 이미지 이해 능력을 동시에 끌어올린 원리를 짚었다. 40만 스텝으로 700만 스텝의 성능을 넘어선 실험 결과도 함께 살폈다.
핵심 내용 읽기 →
사카나AI의 연속 사고 기계(CTM) 논문 해설. 입력과 분리된 내부 시간축, 뉴런마다 붙은 작은 신경망, 뉴런 동기화로 만드는 잠재 표현, 확신도에 따라 사고를 멈추는 적응형 연산과 미로 실험 결과를 정리했다.
핵심 내용 읽기 →
센스타임이 공개한 SenseNova-U1은 이미지 이해와 생성을 하나의 구조로 합친 통합 멀티모달 모델이다. 비전 인코더와 VAE를 없앤 NEO-unify 구조와 주요 벤치마크 성적, 남은 한계를 정리했다.
핵심 내용 읽기 →
논문 'Optimizing LLM Training Using FP4 Quantization'은 가중치·활성값을 4비트로 양자화해 130억 파라미터 라마를 BF16과 거의 같은 곡선으로 학습한다. 이상치 클램핑·미분가능 그래디언트 추정 등 핵심 기법을 AI Coffee Break가 해설한다.
핵심 내용 읽기 →
'Less is More' 논문의 Tiny Recursive Model은 700만 파라미터·단일 모듈로 계층적 추론 모델(HRM)을 넘어, 스도쿠·미로·ARC-AGI에서 훨씬 큰 추론 모델을 앞선다. 잠재 추론과 재귀 정제, 적응적 정지 구조를 정리한다.
핵심 내용 읽기 →
LLM의 사고의 사슬(CoT)을 언어 토큰이 아닌 연속 벡터로 수행하는 COCONUT 논문을 해설한다. 학습 방식, 계산량 절감, 해석 가능성 문제까지 짚는다.
핵심 내용 읽기 →