HRM 논문 분석: 2700만 파라미터 계층적 추론 모델의 구조와 ARC-AGI 성적 논란
싱가포르 연구소가 내놓은 계층적 추론 모델 HRM은 사전학습 없이 2700만 파라미터로 ARC-AGI 순위표에 올랐다. 잠재 재귀 구조와 데이터 증강 방식, 그리고 벤치마크 평가를 둘러싼 논란을 함께 짚어 본다.
핵심 내용 읽기 →AI TOPIC
AI 추론 관련 핵심 뉴스와 활용 인사이트 13편을 최신순으로 모았습니다.

싱가포르 연구소가 내놓은 계층적 추론 모델 HRM은 사전학습 없이 2700만 파라미터로 ARC-AGI 순위표에 올랐다. 잠재 재귀 구조와 데이터 증강 방식, 그리고 벤치마크 평가를 둘러싼 논란을 함께 짚어 본다.
핵심 내용 읽기 →
ETH 취리히 로봇 학습 강의는 데이터를 더 모으는 대신 추론을 학습시키는 접근을 다룬다. 체화된 사고 사슬로 일반화가 약 30% 오르지만 행동이 느려지는 문제를 어떻게 되돌리는지, 테스트 시점 연산의 한계는 어디인지 정리했다.
핵심 내용 읽기 →
에너지 기반 모델은 다음 토큰을 예측하는 대신 답 전체가 조건에 맞는지 점수를 매긴다. 스도쿠 데모와 Lean 형식 증명 성적을 통해 언어모델의 추론과 무엇이 다른지, 어떤 분야에서 중요한지 정리했다.
핵심 내용 읽기 →
베이스텐 CEO 투힌 스리바스타바가 AI 추론 수요 폭증과 GPU 공급 부족, 오픈 모델 커스터마이징 확산을 이야기했다. 추론이 왜 '마지막 시장'이라 불리는지, 그리고 무엇이 승부를 가르는지 정리했다.
핵심 내용 읽기 →
세레브라스 창업자 앤드루 펠드먼이 No Priors에 나와 접시 크기 칩을 만들기까지 겪은 2년의 실패, 아무도 찾지 않던 시장보다 앞선 3년, 4주 반 만에 성사된 200억 달러대 OpenAI 계약을 이야기했다.
핵심 내용 읽기 →
체스·바둑 게임 AI의 세계 모델과 몬테카를로 탐색에서 시작해, 알파고와 MuZero의 자가 학습, 세계 모델 학습, 그리고 사고의 사슬·생각의 나무·강화학습으로 이어진 AI 추론 능력의 발전 계보를 짚었다.
핵심 내용 읽기 →
Groq 창업자 조너선 로스가 구글에서 TPU를 개척한 경험, 추론에 특화된 LPU의 메모리 구조와 GPU와의 하이브리드 협업, 정적 스케줄링, 그리고 제번스 역설이 부르는 끝없는 컴퓨팅 수요를 두루 이야기한다.
핵심 내용 읽기 →
오픈소스 프로젝트 LLM-D가 추론 게이트웨이와 프리필·디코드 분리로 LLM 추론을 어떻게 가속하는지, IBM이 공개한 지연·비용 개선 수치와 함께 정리했습니다.
핵심 내용 읽기 →
AI 비용의 대부분은 학습이 아닌 추론 단계에서 발생한다. 양자화로 모델을 FP16에서 INT8·INT4로 줄여 GPU 요구량과 비용을 낮추고 처리량을 높이는 원리를 정리했다.
핵심 내용 읽기 →
대규모 언어 모델(LLM)이 무엇인지부터 토큰과 컨텍스트 윈도우, 생각하는 추론 모델, 도구 사용으로 에이전트가 되는 과정, 그리고 주요 모델 비교까지 초보자 눈높이로 정리했다.
핵심 내용 읽기 →
컴퓨팅을 늘려도 AI가 빨라지지 않는 이유와, 딥시크가 GPU 활용률을 40%에서 약 80%로 끌어올린 방법을 Two Minute Papers의 설명으로 쉽게 풀이한다.
핵심 내용 읽기 →
스탠퍼드 CS336 초청 강연에서 댄 푸가 언어모델 추론의 작동 방식, 프리필·디코드와 KV 캐시, 메가 커널과 루프 트랜스포머 PARSE 연구를 설명했다.
핵심 내용 읽기 →
스탠퍼드 강연에서 베이스텐 공동창업자 투힌이 AI 추론 비용 구조, 오픈소스 맞춤형 모델의 가치, GPU 부족과 컴퓨트 확보 전략을 설명했다.
핵심 내용 읽기 →