BookWorld 논문 리뷰: 소설 세계관을 그대로 옮긴 LLM 다중 에이전트 시뮬레이션의 구조와 평가
딥러닝 논문읽기 모임이 소개한 BookWorld 논문 리뷰. 소설에서 캐릭터와 세계관을 추출해 롤 에이전트와 월드 에이전트로 나누고, 장면 단위 시뮬레이션으로 새 이야기를 만들어내는 구조와 평가 방식을 정리했다.
핵심 내용 읽기 →AI TOPIC
논문 리뷰 관련 핵심 뉴스와 활용 인사이트 67편을 최신순으로 모았습니다.

딥러닝 논문읽기 모임이 소개한 BookWorld 논문 리뷰. 소설에서 캐릭터와 세계관을 추출해 롤 에이전트와 월드 에이전트로 나누고, 장면 단위 시뮬레이션으로 새 이야기를 만들어내는 구조와 평가 방식을 정리했다.
핵심 내용 읽기 →
대규모로 사전학습된 ViT는 어댑터와 픽셀 디코더 없이도 이미지 분할을 해낸다는 EoMT 논문을 정리했다. 구성 요소를 하나씩 걷어내며 속도는 약 4.4배 빨라지고 정확도 손실은 1.1 PQ에 그친 실험과 마스크 어닐링 기법까지 살펴본다.
핵심 내용 읽기 →
허깅페이스에서 내려받은 사전학습 모델의 가중치가 미리 조작돼 있다면, 파인튜닝에 쓴 데이터가 원본 그대로 복원될 수 있다. ETH 취리히 논문이 밝힌 프라이버시 백도어의 작동 방식과 한계를 정리했다.
핵심 내용 읽기 →
딥러닝 논문읽기 모임이 소개한 Parallel Scaling Law 논문을 정리했다. 파라미터도 추론 토큰도 아닌 병렬 연산을 늘려 메모리와 지연 시간 부담 없이 성능을 끌어올리는 방식과, 기존 모델에 적용하는 2단계 학습 전략까지 짚는다.
핵심 내용 읽기 →
싱가포르 연구소가 내놓은 계층적 추론 모델 HRM은 사전학습 없이 2700만 파라미터로 ARC-AGI 순위표에 올랐다. 잠재 재귀 구조와 데이터 증강 방식, 그리고 벤치마크 평가를 둘러싼 논란을 함께 짚어 본다.
핵심 내용 읽기 →
ACL 2024 최우수 논문 '미션 임파서블 언어 모델'은 사람이 배울 수 없는 인공 언어를 여러 단계로 만들어 GPT-2를 처음부터 학습시켰고, 언어가 불가능해질수록 학습이 어려워진다는 결과로 촘스키의 주장을 반박했다.
핵심 내용 읽기 →
보상이 희박한 3D 미로에서 예측 오차 기반 호기심 보상이 왜 실패하는지, 그리고 '기억 속 장면에서 몇 걸음 만에 닿는가'로 새로움을 다시 정의한 에피소딕 큐리오시티가 DMLab과 VizDoom 실험에서 어떤 결과를 냈는지 정리했습니다.
핵심 내용 읽기 →
이미지 트랜스포머에 BERT식 사전학습을 이식한 BEiT를 다룬 국내 논문 리뷰 세미나 내용을 정리했다. 비주얼 토큰과 블록 단위 마스킹의 설계 의도, 그리고 성능 향상의 공을 어디에 돌려야 하는지에 대한 토론까지 담았다.
핵심 내용 읽기 →
라벨 없는 이미지 학습을 사전 탐색 문제로 다시 본 MoCo 논문 리뷰입니다. 큐로 사전 크기를 키우고 모멘텀 인코더로 키 표현의 일관성을 지키는 원리, 그리고 지도학습 사전학습과 비교한 전이 실험 결과를 한국어로 정리했습니다.
핵심 내용 읽기 →
비전-언어 사전학습 모델 UNITER를 다룬 논문 리뷰 발표를 정리했다. 이미지 영역 특징과 문장 토큰을 한 트랜스포머에 함께 넣고, 단어와 영역 마스킹 예측부터 최적 수송을 쓴 단어-영역 정렬까지 네 가지 과제로 학습하는 구조를 설명한다.
핵심 내용 읽기 →
논문익는마을의 Masked Autoencoders Are Scalable Vision Learners 리뷰를 정리했다. 마스킹 비율 75%, 마스크 토큰을 인코더에서 뺀 비대칭 구조, 패치별 정규화 타깃 등 실험으로 결정된 설계를 짚는다.
핵심 내용 읽기 →
이미지를 문장으로 옮기는 캡셔닝 모델에 사람의 시선처럼 움직이는 어텐션을 붙인 2015년 논문을, 국내 논문 리뷰 세미나 발표를 토대로 소프트·하드 두 방식의 차이와 어텐션 시각화가 주는 설명력까지 차근차근 정리했다.
핵심 내용 읽기 →
바운딩 박스 주석 없이 웹에서 모은 이미지와 캡션 쌍으로 먼저 사전 학습한 뒤 객체 탐지로 전이하는 오픈 보캐뷸러리 방식을 논문 리뷰로 정리했다. 제로샷·약지도 탐지와의 차이, 그리고 평가에 남은 한계까지 짚는다.
핵심 내용 읽기 →
각각의 인코더로 정렬하던 방식에서 융합 전에 정렬하는 방식까지, 비전-언어 사전학습의 계보를 짚고 여기에 모달리티 내부 대조 학습과 지역 정보 상호정보량을 더한 TCL 논문을 국내 스터디 세미나 발표로 정리했다.
핵심 내용 읽기 →
GAN이 지배하던 이미지 생성에서 디퓨전 모델이 앞서게 된 과정을 다룬 한국어 논문 리뷰다. 다양성과 충실도의 맞교환, 대규모 실험을 통한 아키텍처 개선, 그리고 분류기 가이던스가 작동하는 원리를 차근차근 짚는다.
핵심 내용 읽기 →
GPT 같은 거대 모델을 로봇에 접목하는 연구를 정리한 서베이 논문 해설. 언어 기반 모방 학습부터 가치 학습, 태스크 플래닝, RT 시리즈, 오픈 보캐블러리 내비게이션까지 로봇 AI의 현재 지형을 짚는다.
핵심 내용 읽기 →
오픈AI의 CLIP 논문을 스터디 발표로 정리했다. 라벨 대신 자연어를 감독 신호로 쓰는 발상부터 대조 학습 사전 훈련 구조, 프롬프트 엔지니어링의 효과, 27개 데이터셋 실험 결과와 약점까지 차근히 짚는다.
핵심 내용 읽기 →
GPT-4가 사람 대신 챗봇 답변을 채점하면 인간 평가자와 85% 일치했다. MT-Bench와 챗봇 아레나를 제안한 LLM-as-a-Judge 논문이 밝힌 평가 방식 세 가지와 위치·장황함·자기선호 편향, 그리고 그 완화책을 정리했다.
핵심 내용 읽기 →
코딩 에이전트처럼 로봇 프로그램을 실행하고 실패 원인을 추적해 코드를 고치는 엔비디아 ASPIRE 연구 정리. 실행 엔진과 진화적 탐색이 성공률을 14%에서 72%로 끌어올린 과정과 스킬 라이브러리 전이 실험을 짚는다.
핵심 내용 읽기 →
맘바와 S4의 성능이 정교한 구조 덕분인지 묻는 논문을 해설한 영상이다. 옛 GRU와 LSTM에서 은닉 상태 의존성만 걷어내면 병렬 학습이 가능해지지만, 이를 뒷받침할 실험은 매우 약하다는 지적이 이어진다.
핵심 내용 읽기 →
구글 딥마인드와 UC 버클리가 쓴 테스트 타임 컴퓨팅 논문을 야닉 킬처가 뜯어봤다. 추론 단계에 연산을 더 쓰는 방법들을 비교하고, 사전학습 확대와 어느 쪽이 유리한지, 저자들의 일반화 주장이 어디까지 믿을 만한지 짚는다.
핵심 내용 읽기 →
서울대 DSBA 연구실이 타우 벤치와 후속 연구를 리뷰하며 멀티턴 상호작용과 정책 준수, 반복 일관성을 함께 재야 하는 이유를 정리하고, 사용자와 협업할 때 오히려 점수가 떨어지는 평가 결과를 짚었다.
핵심 내용 읽기 →
딥러닝 논문읽기 모임이 다룬 엔비디아 GR00T N1을 정리했다. 느린 추론과 빠른 행동 생성을 나눈 듀얼 시스템 구조, 웹·합성·실제 로봇 데이터를 쌓은 데이터 피라미드, 그리고 제로샷 성공률과 남은 한계를 짚는다.
핵심 내용 읽기 →
프로세스 보상 모델의 오차가 답변이 길어질수록 증폭돼 액션 단위 리젝션 샘플링의 성능에 넘을 수 없는 한계를 만든다는 점을 이론으로 보이고, 되돌아가기를 섞은 새 알고리즘 VGB로 그 한계를 넘는 논문 리뷰를 정리했다.
핵심 내용 읽기 →
KAIST 연구실에서 나온 옵티마이저 논문 AMUSE를 소개하는 발표를 정리했다. 샤프니스와 엣지 오브 스태빌리티, 도미넌트·벌크 부분공간, 리버 밸리 손실 지형이라는 관점으로 Muon과 스케줄 프리 방식의 강점을 차례로 설명한다.
핵심 내용 읽기 →
언어 모델 선호 파인튜닝에서 이론상 같은 곳에 도달해야 할 RLHF와 DPO가 실제 결과에서는 성능 차이를 낸다. 후보 가설 여섯 개를 하나씩 실험으로 걸러낸 끝에 남은 답은 생성보다 검증이 쉽다는 난이도 차이였다.
핵심 내용 읽기 →
쉬운 문제에 오래 생각하면 낭비이고 어려운 문제를 급히 답하면 오답이다. 과정 보상 모델의 점수를 실제 성공 확률에 맞게 보정해 문제마다 추론 계산량을 다르게 쓰는 방법을 논문 리뷰 영상으로 살펴본다.
핵심 내용 읽기 →
SNS에서 화제가 된 'Attention Is Not What You Need' 논문을 수학 전공자가 뜯어봤다. 그라스만 다양체 아이디어의 신선함과, 실험 규모·연산 최적화에서 드러난 한계를 정리한다.
핵심 내용 읽기 →
정답 레이블이 없는 테스트 데이터만으로 언어 모델의 추론 성능을 끌어올리는 TTRL 논문 리뷰를 정리했다. 모델이 스스로 만든 다수결 결과를 추정 레이블 삼아 보상을 주는 방식과, 사전 지식이 부족할 때 드러나는 한계까지 함께 짚는다.
핵심 내용 읽기 →
해석가능성 연구자 닐 난다가 앤트로픽의 LLM 내성 논문을 처음 읽으며 실시간으로 평가한다. 개념 벡터 주입 실험의 설계, 정말 놀라운 결과와 더 단순하게 설명되는 결과, 낮은 성공률의 의미를 짚는다.
핵심 내용 읽기 →
닐 난다가 활성화 오라클과 예측 개념 디코더 두 논문을 실시간으로 읽으며, 해석가능성에 쓰라린 교훈을 적용한 종단간 접근이 어디까지 통하고 어디서 막히는지, 비용은 얼마나 드는지 조목조목 짚어 본다.
핵심 내용 읽기 →
구글 리서치가 ICML 2023에서 발표한 스페큘레이티브 디코딩은 작은 초안 모델이 토큰 여러 개를 먼저 제안하고 큰 모델이 한 번에 검증하는 구조다. 출력 결과를 전혀 바꾸지 않으면서 생성 속도만 끌어올린다.
핵심 내용 읽기 →
첫 질문에 한 번만 검색하는 기존 RAG는 긴 글에서 환각을 막지 못한다. 모델이 자기 확신도를 보고 검색 시점을 스스로 정하고, 앞으로 쓸 문장을 미리 만들어 질의로 삼는 FLARE의 구조와 실험 결과를 정리했다.
핵심 내용 읽기 →
이미지 한 장에 47초가 걸리던 객체 검출이 어떻게 수십 밀리초까지 내려왔을까. R-CNN에서 RT-DETR까지 판을 바꾼 논문 다섯 편이 특징 맵 재사용, 앵커 박스, 집합 예측, 하이브리드 인코더로 병목을 걷어낸 과정을 정리했다.
핵심 내용 읽기 →
렌즈 초점거리도 촬영 각도도 모르는 흔들린 사진 몇 장. 네이버랩스 유럽의 MUSt3R는 두 장씩 짝짓는 방식을 버리고 메모리 구조를 도입해 다중 시점을 한 번에 3D 공간으로 복원한다. 논문의 구조와 실험 결과를 살펴본다.
핵심 내용 읽기 →
거리에서 찍은 사진만으로 3D 도시 모델을 만든 컴퓨터 비전 연구를 짚어본다. 360도 카메라로 시야 단절을 없애고, 시각 단어 사전과 루프 클로징, 번들 조정으로 누적 오차를 바로잡은 과정을 정리했다.
핵심 내용 읽기 →
텍스트만으로 3D를 만드는 드림퓨전은 부족한 3D 학습 데이터를 포기하고 2D 확산 모델을 심판으로 세웠다. 핵심 기법인 점수 증류 샘플링과 얼굴이 여러 개 생기는 야누스 문제, 평면 판자 꼼수까지 짚어 봤다.
핵심 내용 읽기 →
고정된 어휘 사전으로 텍스트를 자르는 대신, 다음 바이트 예측이 불확실해지는 지점에서 바이트를 묶어 패치로 만드는 구조를 다룬다. 두 겹으로 나뉜 모델이 어떻게 연산을 아끼고 무엇을 얻는지, 한계는 무엇인지 정리했다.
핵심 내용 읽기 →
ICLR 2025에 발표된 LAPA는 로봇 액션 라벨 없이 인터넷 영상만으로 VLA를 사전학습한다. 잠재 액션이라는 핵심 아이디어와 세 단계 학습 구조, 사람 영상만으로 OpenVLA를 앞선 대목과 남은 한계까지 정리했다.
핵심 내용 읽기 →
여러 장의 사진에서 카메라 위치와 깊이, 3D 포인트를 반복 최적화 없이 한 번의 신경망 통과로 예측하는 메타의 VGGT 논문을, 모델 구조와 주요 실험 결과, 그리고 남아 있는 한계까지 발표 내용 그대로 정리했습니다.
핵심 내용 읽기 →
CLIP 같은 비전-언어 모델의 프롬프트를 연속값 대신 이산 코드북으로 양자화하면 학습하지 않은 클래스에서 성능이 오른다. 양자화 오류를 일반화에 유리한 노이즈로 활용한 QPrompt 논문 리뷰를 정리했다.
핵심 내용 읽기 →
행동을 직접 예측하는 대신 목표를 이루는 미래 영상을 먼저 만들고 그 영상에서 실제 제어 신호를 뽑아내는 UniPi 논문을, 딥러닝논문읽기모임 발표를 따라가며 확산 모델 구조와 실험 결과, 남은 한계까지 정리했다.
핵심 내용 읽기 →
허깅페이스 연구팀이 애플의 자기 증류 논문을 함께 읽었다. 높은 온도로 스스로 뽑은 출력을 정답 검증 없이 학습시키자 코드 생성 성능이 올랐다는 결과를 두고 왜 통하는지와 어떤 실험이 빠졌는지를 토론했다.
핵심 내용 읽기 →
사람의 선호도 라벨이 비싸고 느리다는 RLHF의 약점을 AI 피드백으로 대체한 RLAIF 논문을 정리했다. 요약과 대화 생성 과제에서 사람 수준의 선호도가 나온 이유, 보상 모델을 없앤 d-RLAIF, 위치 편향 같은 한계를 함께 살펴본다.
핵심 내용 읽기 →
딥러닝논문읽기모임이 다룬 AnyGrasp 리뷰 정리. 학습하지 않은 물체와 움직이는 물체까지 7자유도로 집어내는 구조, 무게중심 고려, 실험 결과와 한계를 짚는다.
핵심 내용 읽기 →
이미 찍은 사진의 초점을 옮기고 흐림을 지우는 AI 모델의 원리를 카메라 광학부터 설명한다. 핀홀과 렌즈, 착란원 공식으로 학습 데이터를 직접 합성해 흐림을 지우는 모델과 만드는 모델을 함께 훈련시키는 과정을 따라간다.
핵심 내용 읽기 →
미국 법률 시스템을 겨냥한 LawLLM 논문 해설. 글자만 비슷한 유사 판례와 구속력 있는 선례를 분리해 지식 그래프로 학습시키고, 판결 예측 정확도 79.4%와 환각률 0.1%를 이끌어낸 과정을 정리했다.
핵심 내용 읽기 →
에너지 기반 트랜스포머(EBT) 논문 리뷰 정리. 답을 한 번에 내놓는 대신 에너지 함수를 경사하강으로 최적화해 답을 다듬는 구조와 학습 정규화 기법, 확장성 실험 결과와 남은 한계를 함께 짚었다.
핵심 내용 읽기 →
서울대 DSBA 연구실 스터디가 연구 워크플로 자체를 자동화하는 '리서치 에이전트' 논문 두 편을 비교했다. 완전 자율을 노린 AI 사이언티스트와 사람이 개입하는 에이전트 래버러토리의 결과를 통해, 지금의 병목은 생성이 아니라 검증이라는 결론을 짚는다.
핵심 내용 읽기 →
앤트로픽이 클로드 3.5 하이쿠 내부를 들여다본 보고서를 야닉 킬처가 비판적으로 짚었다. 모델이 운율을 미리 계획하고 중간 개념을 실제로 떠올린다는 증거, 다국어 회로의 층별 구조, 방법론의 한계를 함께 정리했다.
핵심 내용 읽기 →
확산 기반 LLM은 여러 토큰을 한 번에 만들 수 있는데도 KV 캐시를 쓸 수 없어 실제로는 느렸다. 시퀀스를 블록으로 나눠 두 장점을 함께 취한 D2F 방식과 자기회귀 모델을 처음 앞지른 실험 결과를 정리했다.
핵심 내용 읽기 →
딥러닝논문읽기모임이 양팔 로봇 조작용 확산 파운데이션 모델 RDT-1B를 해설한다. 통합 행동 공간과 확산 정책으로 처음 보는 물체까지 다루는 구조를 짚는다.
핵심 내용 읽기 →
이미지에 없는 사물을 설명하는 비전 언어 모델의 환각을 줄이려는 OViP 논문 발표를 정리했다. 학습 중 부정 이미지를 직접 생성해 쓰는 구조와, 환각만 잡다 일반 성능을 놓친 기존 기법의 문제를 함께 짚는다.
핵심 내용 읽기 →
모델 가중치를 전혀 건드리지 않고 에이전트에게 건네는 마크다운 지침 문서만 훈련하는 방법이다. 텍스트 학습률과 검증 게이트를 앞세워 52개 비교에서 모두 최고를 기록한 마이크로소프트 스킬옵트 논문을 정리했다.
핵심 내용 읽기 →
서로 다른 카메라에서 같은 사람을 찾는 인물 재식별에서, ReID 백본을 추가 학습하지 않고도 성능을 높이는 Pose2ID의 특징 중앙화·자세 기반 이미지 생성·이웃 보정 방법을 정리했다.
핵심 내용 읽기 →
3D 가우시안 스플래팅으로 1.5제곱킬로미터급 도시를 실시간 렌더링한 CityGaussian 논문을 정리했다. 메모리 폭발을 피하는 분할 정복, SSIM 기반 사진 배분, 블록 단위 LOD가 어떻게 초당 53.7프레임을 만들어냈는지 짚었다.
핵심 내용 읽기 →
네이처에 실린 구글 딥마인드의 대화형 진단 AI 논문을 다룬 발표를 정리했다. 가상 환자 연기자와의 채팅 실험에서 진단 정확도와 공감 지표 모두 실제 1차 진료의를 앞섰지만, 텍스트 한계와 책임 소재 문제가 남았다.
핵심 내용 읽기 →
CVPR 2024 구두 발표 논문 InternVL은 비전 인코더를 60억 파라미터로 키우고 언어 미들웨어를 끼워 넣었다. 기존 경량 연결층의 한계와 3단계 학습, 스위스 아미 나이프식 조합 구조를 정리했다.
핵심 내용 읽기 →
에모리대 연구진이 내놓은 GRAG는 텍스트 조각만 긁어오는 기존 RAG의 한계를 지적한다. 부분 그래프 추출과 부드러운 가지치기, 텍스트·그래프 이중 입력으로 환각을 줄인 원리와 실험 수치를 알기 쉽게 정리했다.
핵심 내용 읽기 →
작은 드래프트 모델이 고른 후보 토큰만 살펴 조기 종료 판단 비용을 줄인 SpecEE 논문 리뷰. 라마2 7B에서 클라우드 2.25배, PC 2.43배 속도를 얻은 세 가지 최적화와 정확도 손실을 정리했다.
핵심 내용 읽기 →
메타가 공개한 SAM 3는 짧은 명사구만 입력하면 이미지와 영상 속 해당 개체를 모두 찾아 분할하고 추적한다. 디텍터와 트래커 분리, 프레즌스 토큰, 사람과 AI가 함께 만든 데이터 엔진을 짚었다.
핵심 내용 읽기 →
서울대 DSBA 연구실 세미나가 공개 지식 그래프 다섯 곳의 품질 비교 논문과 구축 파이프라인 논문을 함께 짚었다. 클래스 규모보다 온톨로지 설계가 품질을 가른다는 분석과 증분 갱신 과제를 정리했다.
핵심 내용 읽기 →
딥러닝논문읽기모임이 소개한 VCRL은 롤아웃 정답률의 분산으로 문제 난이도를 재고 메모리 뱅크로 좋은 문제를 재활용해, LLM 수학 추론 강화학습의 표본 효율과 학습 안정성을 함께 끌어올린 방법이다.
핵심 내용 읽기 →
CVPR 2025 하이라이트 논문 리뷰. 대규모 비전 언어 모델 안에는 텍스트가 가리키는 영역에 이미 집중하는 어텐션 헤드가 존재하며, 이를 골라 쓰면 추가 학습 없이도 객체를 찾아낼 수 있다.
핵심 내용 읽기 →
벡터 임베딩 검색에는 차원 수에 따른 이론적 한계가 있다는 논문을 해설한다. 사인랭크로 유도한 임계 차원과 실험 결과, 이 한계가 실제 RAG 시스템 설계에 어떤 의미인지, 그리고 임베딩이 유독 약한 질의 유형은 무엇인지 짚어본다.
핵심 내용 읽기 →
코딩 에이전트를 돌려놓고 겨루는 해커톤이 ICML 기간에 '오토 리서치'를 주제로 열렸다. 15살 참가자부터 대학 교수, 지난 대회 우승자까지 무엇을 만들고 어떤 고민을 나눴는지 현장 대화를 정리했다.
핵심 내용 읽기 →
구글의 Titans 논문이 제안한 "테스트 시점에 기억을 학습하는" 신경망 메모리 아이디어와, 선형 트랜스포머·기존 메모리 기법과의 관계를 비판적으로 정리합니다.
핵심 내용 읽기 →