재귀 언어 모델(RLM) 정리: 긴 문맥 한계를 파이썬 REPL로 우회하는 추론 전략
MIT 알렉스 장이 alphaXiv 강연에서 소개한 재귀 언어 모델(RLM)은 프롬프트를 모델에 직접 넣지 않고 코드 환경 변수에 담아, 모델이 스스로 잘라 읽고 하위 호출로 처리하게 만드는 추론 전략이다.
핵심 내용 읽기 →AI TOPIC
LLM 추론 관련 핵심 뉴스와 활용 인사이트 47편을 최신순으로 모았습니다.

MIT 알렉스 장이 alphaXiv 강연에서 소개한 재귀 언어 모델(RLM)은 프롬프트를 모델에 직접 넣지 않고 코드 환경 변수에 담아, 모델이 스스로 잘라 읽고 하위 호출로 처리하게 만드는 추론 전략이다.
핵심 내용 읽기 →
MIT 알렉스 장이 제안한 재귀 언어모델(RLM)은 긴 프롬프트를 모델에 직접 넣는 대신 파이썬 실행 환경에 저장해 두고, 모델이 코드로 훑어보며 자기 자신을 부분 호출해 답을 만든다. 서브에이전트 도구 호출과 무엇이 다른지 정리했다.
핵심 내용 읽기 →
프런티어 모델이 암호화해 감춘 추론 과정이 같은 제품군의 값싼 모델을 통해 평문으로 복원됐다. 암호 봉투의 이식성이 만든 허점, 공개된 실행 로그에서 실제 자격 증명이 새어 나온 실태, 화면에 보이는 추론 요약이 실제와 어긋난 사례까지 정리했다.
핵심 내용 읽기 →
뉴욕대 그레그 더렛 교수가 연구소 세미나에서 발표한 LLM 추론 강연을 정리했다. 사고 사슬이 수학에서만 잘 듣는 이유, 강화학습이 기존 행동만 증폭한다는 관찰, 에이전트가 자기 불확실성을 다루는 방법을 다룬다.
핵심 내용 읽기 →
마이크로소프트 엔지니어가 파이토치 콘퍼런스에서 정리한 LLM 추론 최적화 지도. 자체 호스팅을 해야 하는지부터 모델 선택과 양자화, KV 캐시 관리, 추측 디코딩과 분리 추론까지 난이도순으로 짚는다.
핵심 내용 읽기 →
대학 LLM 강의가 추론 서빙 기술을 한자리에 정리했다. 프리필과 디코드가 왜 다른지, TTFT·TPOT·굿풋은 무엇을 재는 지표인지, 페이지드 어텐션과 연속 배칭·추측 디코딩·양자화가 서빙 비용을 어떻게 줄이는지 짚었다.
핵심 내용 읽기 →
IBM 테크놀로지가 UC 버클리에서 출발한 오픈소스 추론 엔진 vLLM을 소개하며 GPU 메모리 낭비와 응답 지연, 확장의 어려움을 페이지드 어텐션과 연속 배치로 푸는 원리와 실제 도입 방법을 설명했다.
핵심 내용 읽기 →
프로세스 보상 모델의 오차가 답변이 길어질수록 증폭돼 액션 단위 리젝션 샘플링의 성능에 넘을 수 없는 한계를 만든다는 점을 이론으로 보이고, 되돌아가기를 섞은 새 알고리즘 VGB로 그 한계를 넘는 논문 리뷰를 정리했다.
핵심 내용 읽기 →
쉬운 문제에 오래 생각하면 낭비이고 어려운 문제를 급히 답하면 오답이다. 과정 보상 모델의 점수를 실제 성공 확률에 맞게 보정해 문제마다 추론 계산량을 다르게 쓰는 방법을 논문 리뷰 영상으로 살펴본다.
핵심 내용 읽기 →
CMU 그레이엄 뉴빅의 LLM 추론 강의가 그리디 탐색과 빔서치부터 A*, 최선 우선 빔서치까지 정리한다. 모델이 좋아진 지금 왜 다시 제대로 탐색할 때인지, 언어모델에 최적 탐색이 어려운 이유는 무엇인지 짚었다.
핵심 내용 읽기 →
카네기멜런대 그레이엄 뉴빅의 LLM 추론 강의를 정리했다. 에이전트의 계획 방식과 화면 표현, 수천만 토큰까지 늘어나는 컨텍스트를 다루는 방법, 재순위로 점수를 올리는 대가, 멀티에이전트가 실제로 유리한 조건을 다룬다.
핵심 내용 읽기 →
긴 사고 과정을 쓰는 추론 모델은 어떤 원리로 학습될까. CMU 강의는 STaR와 DeepSeek R1, GRPO 손실함수, 응답 길이 폭주 문제, 강화학습이 지도학습보다 잘 전이되는 이유까지 차례로 짚는다.
핵심 내용 읽기 →
카네기멜런대 LLM 추론 강의 첫 시간이 언어 모델의 실행 비용을 뜯어봤다. 긴 문맥에서 어텐션이 왜 급격히 비싸지는지, 학습과 추론이 어떻게 다른지, 탐색 오류와 모델 오류를 왜 구분해야 하는지 정리했다.
핵심 내용 읽기 →
vLLM 공동 리드 사이먼 모가 오픈소스 추론 엔진의 출발점과 현재를 이야기한다. KV 캐시 관리에서 시작해 분산 추론과 강화학습 스택 연동, 재단 합류까지 이어지는 흐름을 따라가며 추론 효율이 왜 곧 비용 문제인지 짚는다.
핵심 내용 읽기 →
정답 레이블이 없는 테스트 데이터만으로 언어 모델의 추론 성능을 끌어올리는 TTRL 논문 리뷰를 정리했다. 모델이 스스로 만든 다수결 결과를 추정 레이블 삼아 보상을 주는 방식과, 사전 지식이 부족할 때 드러나는 한계까지 함께 짚는다.
핵심 내용 읽기 →
서울대 DSBA 연구실 스터디가 리액트와 리플렉션 논문을 정리했다. 생각의 사슬과 외부 도구 사용을 결합한 리액트, 실패를 스스로 평가해 다음 시도를 고치는 리플렉션이 오늘날 에이전트의 뼈대가 된 과정을 짚는다.
핵심 내용 읽기 →
애플 연구진은 GSM8K 문제를 템플릿으로 바꿔 변형 문제를 대량 생성하는 GSM-Symbolic을 만들었다. 이름만 바꾸면 성적이 유지되지만 숫자를 바꾸거나 무관한 문장을 넣으면 정확도가 크게 떨어진다는 결과와, 그 해석을 둘러싼 반론을 함께 정리했다.
핵심 내용 읽기 →
딥시크 R1의 학습 알고리즘 GRPO는 어디서 왔을까. 정책 경사와 베이스라인, 어드밴티지 추정, 신뢰 영역과 클리핑을 지나 가치망을 없앤 GRPO와 길이·난이도 편향을 걷어낸 Dr. GRPO까지, LLM 추론 학습의 발전 과정을 단계별로 정리했다.
핵심 내용 읽기 →
LLM API의 토큰 가격과 컨텍스트 길이 티어는 왜 그렇게 정해질까. 계산 시간과 메모리 시간의 줄다리기, KV 캐시가 잡아먹는 GPU 메모리, 한 랙에 72개를 묶은 NVL72의 구조를 차례로 따라가며 추론 경제학의 뼈대를 한국어로 풀어본다.
핵심 내용 읽기 →
서울대 AI 콜로퀴움에서 서지원 교수가 딥러닝 학습과 LLM 추론의 GPU 저활용 문제를 해부했다. 역전파 순서를 바꾸는 아웃오브오더 백프롭과, 토큰 지연시간 제약을 지키며 처리량을 최대화하는 추론 스케줄링을 소개한다.
핵심 내용 읽기 →
세미애널리시스 팀이 만든 오픈소스 추론 벤치마크 InferenceX 발표를 정리했다. 최대 처리량 대신 파레토 곡선을 보는 이유, 블랙웰과 FP4가 만든 비용 하락, AMD의 소프트웨어 격차, 그리고 MoE 시대의 서빙 기법을 다룬다.
핵심 내용 읽기 →
UC 버클리 박사과정 연구자가 TTIC 강연에서 대형 언어 모델의 일반화와 환각이 하나의 학습 메커니즘에서 나온다는 분석과, 추론을 텍스트 대신 잠재 공간으로 옮겨 훨씬 작은 모델로 탐색 문제를 푼 실험 결과를 함께 발표했다.
핵심 내용 읽기 →
LLM 추론에서 GPU 메모리의 60~80%를 낭비하게 만드는 KV 캐시 단편화 문제를, 운영체제의 페이징 기법으로 해결한 PagedAttention의 작동 원리와 접두어 공유·연속 배칭의 효과를 정리했다.
핵심 내용 읽기 →
긴 응답을 만드는 요청이 디코더를 붙잡으면 짧은 요청은 계속 기다린다. 파이토치 콘퍼런스 발표가 소개한 토큰 슬라이스는 운영체제 스케줄링의 시분할 아이디어를 LLM 추론에 옮긴 시도이며, 그 대가로 캐시 재계산 비용을 감수해야 한다.
핵심 내용 읽기 →
MoE 모델을 수십 개 GPU에 펼치는 WideEP 추론에서 성능을 갉아먹는 것은 전문가 연산이 아니라 KV 캐시 위치를 무시한 라우팅이었다. vLLM과 llm-d 개발자들이 파이토치 콘퍼런스에서 밝힌 진단과 해법을 정리했다.
핵심 내용 읽기 →
긴 문맥이 비싸고 느린 진짜 이유는 KV 캐시다. 딥시크가 채택한 다중 헤드 잠재 어텐션(MLA)이 키·값을 잠재 벡터로 압축해 캐시를 90% 넘게 줄이는 원리를 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS329A 6강은 모델이 스스로 만든 답 중 정답만 걸러 다시 학습시키는 학습 시간 스케일링을 STaR, GRPO, DAPO 세 논문으로 짚으며, 7B와 32B급 작은 모델이 수학 추론에서 앞선 이유를 설명한다.
핵심 내용 읽기 →
오픈AI가 o1의 학습법을 거의 공개하지 않은 가운데, 기술 문서에 남은 단서와 이전 보상 모델 논문을 겹쳐 사고 사슬 토큰과 결과 감독·과정 감독 보상 모델을 활용한 강화학습 구조를 추론해 정리하고, 강점과 남은 한계까지 함께 짚었다.
핵심 내용 읽기 →
칩 스타트업 MatX의 CEO가 칠판 강의로 프런티어 LLM의 학습과 추론 구조를 직접 계산해 보인다. 배치 크기와 KV 캐시, 메모리 대역폭이 응답 속도와 API 가격을 어떻게 결정하는지 수식으로 짚는다.
핵심 내용 읽기 →
구글이 공개한 KV 캐시 압축 기법 TurboQuant가 메모리 6배 절감과 8배 속도 향상을 내세웠지만, 비교 대상이 현업에서 쓰지 않는 32비트 기준이라는 지적이 나왔다. 기술의 실제 기여와 과장을 구분해 정리했다.
핵심 내용 읽기 →
애리조나주립대 비벡 굽타 교수가 팟캐스트에서 밝힌 LLM의 추론 능력과 취약성, 스케일링의 한계, 학계와 산업계의 역할 분담, 그리고 대학원생을 위한 조언을 자막을 바탕으로 정리했다.
핵심 내용 읽기 →
UC버클리 찰리 스넬이 딥마인드 인턴십에서 진행한 연구를 소개한다. LLM에 추론 시 계산을 더 쓰게 하는 검증기 기반 탐색과 순차 수정 방식이 문제 난이도와 예산에 따라 어떻게 확장되는지, 그리고 언제 모델 크기 키우기보다 나은지를 분석한다.
핵심 내용 읽기 →
오픈소스 LLM을 vLLM으로 효율적으로 서빙하는 방법을 정리했다. 양자화, 페이지드 어텐션, 프리픽스 캐싱으로 메모리를 아끼고 지연·처리량을 측정하는 실전 워크플로를 다룬다.
핵심 내용 읽기 →
딥러닝논문읽기모임이 소개한 VCRL은 롤아웃 정답률의 분산으로 문제 난이도를 재고 메모리 뱅크로 좋은 문제를 재활용해, LLM 수학 추론 강화학습의 표본 효율과 학습 안정성을 함께 끌어올린 방법이다.
핵심 내용 읽기 →
엔비디아 솔루션 아키텍트가 AI 엔지니어 컨퍼런스에서 설명한 LLM 추론의 내부 동작을 정리했다. 프리필과 KV 캐시, 정밀도 축소와 질의 패턴이 GPU 비용과 응답 속도를 어떻게 좌우하는지 살펴본다.
핵심 내용 읽기 →
딥시크 희소 어텐션이 값싼 라이트닝 인덱서로 중요한 토큰을 먼저 추린 뒤 선택된 상위 2048개에만 어텐션을 돌려 긴 문맥 추론 비용을 줄이는 구조를, KV 캐시 병목부터 학습 방식과 한계까지 단계별로 정리했다.
핵심 내용 읽기 →
DeepSeek가 공개한 DSpark(추측 디코딩) 연구를 정리했습니다. 반자기회귀 초안 생성과 서버 부하를 반영한 검증 스케줄링으로 처리량을 최대 수 배 높이는 원리를 다룹니다.
핵심 내용 읽기 →
언어모델은 매 단계 앞 토큰을 다시 계산하면 엄청난 낭비가 생긴다. K와 V만 저장하는 KV 캐시가 이 반복을 어떻게 없애고, 그 대신 사용자당 수십 GB의 메모리·대역폭이라는 비용을 어떻게 치르는지 원리를 정리했다.
핵심 내용 읽기 →
스탠퍼드 CME295 강의가 추론 모델을 어떻게 만드는지 설명한다. 사고 사슬, 검증 가능한 보상 기반 강화학습, GRPO와 PPO의 차이, 그리고 딥시크 R1의 학습 파이프라인까지 핵심을 한국어로 정리했다.
핵심 내용 읽기 →
얀 르쿤이 렉스 프리드먼과의 대화에서 현재 LLM의 추론이 왜 원시적인지, 그리고 답을 텍스트로 내기 전에 추상 표현 공간에서 최적화로 '생각'하는 에너지 기반 모델이 왜 다음 단계인지 설명한다.
핵심 내용 읽기 →
지도 미세조정은 데이터를 모방하는 데 그친다. GRPO 강화학습이 어떻게 여러 답을 생성·비교해 검증 가능한 보상으로 데이터 이상의 추론 능력을 만드는지 시각적으로 풀어본다.
핵심 내용 읽기 →
트랜스포머 언어 모델이 긴 텍스트를 생성할수록 GPU 메모리를 더 많이 쓰는 이유를 KV 캐시로 설명한다. 키·값 행렬을 저장해 매 단계의 재계산을 피하는 원리와 메모리 사용량 계산식, 그리고 300억 파라미터 모델 예시까지 정리했다.
핵심 내용 읽기 →
LLM의 사고의 사슬(CoT)을 언어 토큰이 아닌 연속 벡터로 수행하는 COCONUT 논문을 해설한다. 학습 방식, 계산량 절감, 해석 가능성 문제까지 짚는다.
핵심 내용 읽기 →
LLM이 사고의 연쇄로 추론 토큰을 쏟아내는 대신 트랜스포머 레이어를 반복 실행해 은닉 상태에서 직접 추론하는 '루프 트랜스포머'의 작동 원리와 안정성 문제, 실전 경쟁력의 한계를 정리했다.
핵심 내용 읽기 →
딥시크가 공개한 DSpark는 초안 모델과 검증 모델을 짝지어 여러 토큰을 한 번에 처리하는 투기적 디코딩을 개선해, 자체 모델 기준 응답 속도를 60~85% 높였다.
핵심 내용 읽기 →
사용자가 늘수록 LLM 응답이 느려지는 원인은 모델이 아니라 메모리 사용 방식이다. KV 캐시와 PagedAttention이 어떻게 GPU 처리량을 끌어올리는지, vLLM 설정 팁까지 정리했다.
핵심 내용 읽기 →
중국 AI 랩 미니맥스가 M3 모델에서 풀 어텐션을 스파스 어텐션으로 바꿔 100만 토큰 기준 토큰당 연산을 1/20로 줄였다. GPU 메모리 병목과 최적화 기법을 쉽게 풀이한다.
핵심 내용 읽기 →