재귀 언어모델(RLM) 완전 정리: 긴 문맥을 코드로 쪼개 스스로 호출하는 추론 전략
MIT 알렉스 장이 제안한 재귀 언어모델(RLM)은 긴 프롬프트를 모델에 직접 넣는 대신 파이썬 실행 환경에 저장해 두고, 모델이 코드로 훑어보며 자기 자신을 부분 호출해 답을 만든다. 서브에이전트 도구 호출과 무엇이 다른지 정리했다.
핵심 내용 읽기 →AI TOPIC
롱 컨텍스트 관련 핵심 뉴스와 활용 인사이트 8편을 최신순으로 모았습니다.

MIT 알렉스 장이 제안한 재귀 언어모델(RLM)은 긴 프롬프트를 모델에 직접 넣는 대신 파이썬 실행 환경에 저장해 두고, 모델이 코드로 훑어보며 자기 자신을 부분 호출해 답을 만든다. 서브에이전트 도구 호출과 무엇이 다른지 정리했다.
핵심 내용 읽기 →
2023년 라마 이후 공개된 오픈 웨이트 모델의 설계를 한 강의에서 훑는다. 믹스트랄의 전문가 혼합, 젬마의 어텐션 교차 배치, 딥시크의 보조 손실 없는 로드 밸런싱과 희소 어텐션까지 무엇이 바뀌고 무엇이 그대로인지 정리한다.
핵심 내용 읽기 →
컨텍스트가 길어질수록 LLM이 느려지는 진짜 이유는 연산량이 아니라 KV 캐시 전송이다. CMU 초청 강의가 정리한 압축의 한계와 추측 디코딩·MagicPIG 대안, 긴 문맥 추론 능력을 재는 새 평가 방식을 함께 짚는다.
핵심 내용 읽기 →
딥시크가 R1 이후 1년 4개월 만에 내놓은 V4는 파라미터를 1.6조로 키우면서도 롱컨텍스트 연산량을 이전 세대의 27%, 메모리를 10% 수준으로 낮췄습니다. 그 중심에 희소 어텐션이 있습니다.
핵심 내용 읽기 →
카카오 AI 엔지니어링팀이 if(kakao)25에서 공개한 롱컨텍스트 적용기. 위치 임베딩을 다시 맞추는 학습 없는 보정 기법부터 짧은 문서를 이어 붙여 장문 데이터를 합성하는 학습 전략, 링 어텐션과 데이터 패킹 최적화까지 짚었다.
핵심 내용 읽기 →
딥시크 V4가 압축 희소 어텐션(CSA)과 고압축 어텐션(HCA), 뮤온 옵티마이저와 FP4 양자화 인식 학습, 온폴리시 증류(OPD)를 어떻게 결합해 100만 토큰 문맥의 연산과 메모리 비용을 실용적 수준으로 낮췄는지 정리했습니다.
핵심 내용 읽기 →
2026년 최신 LLM들이 전체 어텐션을 소수 레이어에만 남기고 나머지를 값싼 순환 믹서로 바꾼 이유를, KV 캐시 병목과 델타 규칙·감쇠 게이트, 그리고 하이브리드 설계 관점에서 쉽게 풀어 설명한다.
핵심 내용 읽기 →
백만 토큰 시대에 RAG는 여전히 필요할까요? 롱 컨텍스트와 RAG의 장단점을 비교하고, 어떤 상황에서 무엇을 선택해야 하는지 IBM의 설명으로 정리했습니다.
핵심 내용 읽기 →