BookWorld 논문 리뷰: 소설 세계관을 그대로 옮긴 LLM 다중 에이전트 시뮬레이션의 구조와 평가
딥러닝 논문읽기 모임이 소개한 BookWorld 논문 리뷰. 소설에서 캐릭터와 세계관을 추출해 롤 에이전트와 월드 에이전트로 나누고, 장면 단위 시뮬레이션으로 새 이야기를 만들어내는 구조와 평가 방식을 정리했다.
핵심 내용 읽기 →AI TOPIC
LLM 에이전트 관련 핵심 뉴스와 활용 인사이트 17편을 최신순으로 모았습니다.

딥러닝 논문읽기 모임이 소개한 BookWorld 논문 리뷰. 소설에서 캐릭터와 세계관을 추출해 롤 에이전트와 월드 에이전트로 나누고, 장면 단위 시뮬레이션으로 새 이야기를 만들어내는 구조와 평가 방식을 정리했다.
핵심 내용 읽기 →
AI가 낸 연구 아이디어는 심사에서 사람보다 높은 점수를 받았지만 실제로 실험을 돌리자 점수가 6.0에서 4.13으로 무너졌다. 스탠퍼드 연구팀이 아이디어를 자동으로 코드로 옮겨 GPU에서 검증하는 환경을 만들고 무엇이 통했는지 정리했다.
핵심 내용 읽기 →
앨런 AI 연구소 연구자가 alphaXiv 강연에서 데이터셋만 주고 가설을 스스로 찾게 하는 시스템을 설명한다. 언어 모델의 믿음 변화량을 보상으로 삼는 방식과 비선형 탐색의 효과, 남은 한계까지 정리했다.
핵심 내용 읽기 →
구글 보안 총괄들이 밝힌 AI 취약점 자동화 전략. 깊은 메모리 버그를 오탐 없이 찾아내는 빅 슬립과, 패치를 여러 겹으로 검증해 오픈소스에 178건을 반영한 코드멘더의 작동 방식과 남은 한계를 정리했다.
핵심 내용 읽기 →
AI가 사람의 말로 생각을 풀어 쓰는 지금이 그 의도를 미리 읽어 낼 기회라는 발표를 정리했다. 감시가 통하는 이유와 대규모 강화학습·구조 변화로 이 기회가 곧 닫힐 수 있는 네 가지 위험, 그리고 연구자가 제안한 대응책을 함께 다룬다.
핵심 내용 읽기 →
AI 안전 교육 프로그램 ARENA의 강의가 LLM 에이전트 평가의 기본 구조를 짚었다. 스캐폴딩 설계와 위키피디아 게임 실습, 능력을 최대한 끌어내는 엘리시테이션, 루프에 갇히는 실패 모드까지 정리했다.
핵심 내용 읽기 →
카네기멜런대 고급 NLP 강의가 정리한 LLM 에이전트의 구성 요소. 도구를 부르는 두 가지 방식과 웹 환경 표현, 환경 이해를 돕는 프롬프트, 계획 수정과 오류 복구, 멀티 에이전트의 한계를 실제 사례로 짚는다.
핵심 내용 읽기 →
마인크래프트에서 LLM 에이전트를 움직이는 오픈소스 프로젝트 MINDcraft가 심사 중인 학술 논문으로 정리됐다. 재료를 나눠 가진 봇들이 대화로 협력해 아이템을 만들고 요리하고 건축하는 과제로 모델의 협업 능력을 비교한다.
핵심 내용 읽기 →
IASEAI 2026 세션에서 연구자 9명이 AI 실패를 찾아내고 대응하는 방법을 발표했다. EU 법 위반 벤치마크, 모델의 성능 은폐 탐지, 기만적 정렬 평가, 위임 판단 이론, 증언 아카이브 보호까지 핵심 내용을 정리했다.
핵심 내용 읽기 →
구글 딥마인드 연구자가 LLM으로 게임 에이전트를 만드는 두 방식을 소개했다. 게임 규칙 자체를 코드로 합성하는 코드 월드 모델과, 반칙 수만 걸러 주는 가벼운 하네스를 스스로 진화시키는 방법이다.
핵심 내용 읽기 →
주식 판단을 AI 하나가 아니라 역할을 나눈 AI 팀에게 맡긴 트레이딩에이전트 연구. 강세파와 약세파가 토론하고 리스크 팀이 다시 걸러내는 4단계 구조와, 애플·구글·아마존 세 종목 백테스트에서 드러난 성과와 한계를 정리했다.
핵심 내용 읽기 →
네이처에 실린 구글 딥마인드의 대화형 진단 AI 논문을 다룬 발표를 정리했다. 가상 환자 연기자와의 채팅 실험에서 진단 정확도와 공감 지표 모두 실제 1차 진료의를 앞섰지만, 텍스트 한계와 책임 소재 문제가 남았다.
핵심 내용 읽기 →
AI 음성 튜터 Ace 개발자들이 소개한 하네스 엔지니어링. 모델에 제어 흐름을 맡기지 않고 상태 머신으로 통제해 작은 모델로도 안정적인 에이전트를 만드는 방법을 정리했다.
핵심 내용 읽기 →
Cloudflare의 코드 모드는 MCP 도구를 TypeScript API로 바꿔 LLM이 코드로 호출하게 한다. 왜 더 잘 되는지, 여러 호출을 미리 엮는 방식의 한계와 대안을 Yannic Kilcher가 짚는다.
핵심 내용 읽기 →
클로드 코드 같은 AI 코딩 에이전트는 매 턴 같은 프롬프트 앞부분을 반복 전송한다. 이 영상은 트랜스포머의 KV 캐시를 재사용하는 프롬프트 캐싱이 추론 비용을 어떻게 낮추는지, 캐시를 깨뜨리는 실수와 서버 라우팅·보안 이슈까지 설명한다.
핵심 내용 읽기 →
LLM 에이전트는 대규모 언어 모델을 중심에 두고 메모리·계획·행동 모듈로 환경과 상호작용하는 시스템이다. 이 영상은 '엎질러진 것 치우기' 예시로 단순 LLM, RAG를 붙인 LLM, 그리고 에이전트가 계획을 세우는 방식이 어떻게 다른지 설명한다.
핵심 내용 읽기 →
면접 단골 질문 '도구란 무엇인가'를 오픈소스 코딩 하네스 Pi를 예로 풀어, LLM이 외부 환경과 상호작용하는 방법과 read·bash 등 툴의 정의·설명문·실행 구조를 단계별로 설명한다.
핵심 내용 읽기 →