LLM 에이전트 추론 강의 정리: ReAct와 CodeAct, 컨텍스트 응축, 크리틱 모델과 멀티에이전트의 실제 비용
카네기멜런대 그레이엄 뉴빅의 LLM 추론 강의를 정리했다. 에이전트의 계획 방식과 화면 표현, 수천만 토큰까지 늘어나는 컨텍스트를 다루는 방법, 재순위로 점수를 올리는 대가, 멀티에이전트가 실제로 유리한 조건을 다룬다.
핵심 내용 읽기 →AI TOPIC
에이전트 평가 관련 핵심 뉴스와 활용 인사이트 17편을 최신순으로 모았습니다.

카네기멜런대 그레이엄 뉴빅의 LLM 추론 강의를 정리했다. 에이전트의 계획 방식과 화면 표현, 수천만 토큰까지 늘어나는 컨텍스트를 다루는 방법, 재순위로 점수를 올리는 대가, 멀티에이전트가 실제로 유리한 조건을 다룬다.
핵심 내용 읽기 →
회계 업무를 끝까지 처리하는 에이전트를 만드는 Basis 공동창업자가 장기 실행 에이전트의 설계를 설명한다. 결과만 채점하는 평가의 한계, 과정을 감독하는 행동 명세, 온톨로지와 컨텍스트 설계가 핵심이다.
핵심 내용 읽기 →
AI 에이전트를 한두 개 만드는 것과 회사 전체가 수백 개를 안전하게 굴리는 것은 다른 문제다. 데이터독에서 SRE·개발·보안 에이전트를 만든 경험을 토대로 UX, 실행 방식, 평가, 협업까지 여섯 가지 교훈을 정리했다.
핵심 내용 읽기 →
개발 중 20~30%였던 터미널벤치2 점수는 최근 제출에서 75%까지 올랐다. 제작자 알렉스 쇼가 벤치마크를 표준으로 만드는 조건과 과제 품질을 지키는 방법, 그리고 다음 병목인 검증자 자동화를 이야기했다.
핵심 내용 읽기 →
화면을 클릭하는 대신 터미널로 컴퓨터를 다루는 AI 에이전트는 어떻게 평가해야 할까. 벤치마크 설계에서 감수한 타협과 커뮤니티 운영 방식, 후속 프레임워크가 노린 공통 추상을 개발팀의 말로 정리했다.
핵심 내용 읽기 →
라틴아메리카 최대 디지털 은행 누뱅크가 고객 응대 AI 에이전트의 평가 데이터를 프로덕션이 아닌 시뮬레이션으로 만든 사례. 평가의 병목이 지표가 아니라 데이터인 이유와, 몇 주 걸리던 확인을 하루 안으로 줄인 과정을 정리했다.
핵심 내용 읽기 →
자율적으로 이메일을 보내고 결제까지 하는 AI 에이전트는 기존 골든 데이터셋 방식으로 검증하기 어렵다. 시뮬레이션 환경이 대안이 되는 이유와 그 구성 요소를 정리했다.
핵심 내용 읽기 →
AI 에이전트를 신뢰성 있게 배포·개선하려면 회사 고유의 벤치마크가 필요하다. Snorkel AI 발표자가 프로덕션 트레이스를 반복 가능한 시뮬레이션 환경으로 바꿔 비용·지연·재시도까지 함께 비교하는 방법을 설명합니다.
핵심 내용 읽기 →
랭체인 웨비나가 정리한 AI 에이전트의 네 가지 루프. 도구를 호출하는 기본 루프부터 결과를 채점하는 검증 루프, 슬랙·이메일 같은 이벤트 기반 실행, 트레이스를 분석해 스스로 고쳐 나가는 학습 루프까지 짚어본다.
핵심 내용 읽기 →
에이전트, RAG, MCP, 환각, 메모리, 휴먼 인 더 루프, 평가(evals)까지—AI 에이전트를 처음 접하는 사람을 위한 기본 개념을 문답 형식으로 정리했다.
핵심 내용 읽기 →
스탠퍼드 NLP 연구자가 발표한 Collaborative Gym(Co-Gym)은 인간과 AI 에이전트가 동시에 일하는 이중 제어 환경을 다룬다. 소통·지능적 위임, 알림 시스템, 그리고 협업이 완전 자동화를 능가한다는 실험 결과를 소개한다.
핵심 내용 읽기 →
미국 로컬 비즈니스용 소통 플랫폼 포디움이 문의 응대 AI 에이전트 '제리'를 만들어 1억 달러가 넘는 AI 매출을 올린 과정을 정리했다. 에이전트 품질 확보와 평가 체계, LangSmith 런타임 도입까지의 실전 교훈을 담았다.
핵심 내용 읽기 →
프롬프트 루프에서 자율 실행 액터로 진화한 AI 에이전트. 앤트로픽 제품 리드가 하네스, MCP, 평가, 자기 복구 등 에이전트를 지탱하는 핵심 구조를 설명한다.
핵심 내용 읽기 →
LangChain 엔지니어가 에이전트 평가에 꼭 필요한 세 요소인 격리 샌드박스, 실행 추적, 관측 가능성을 오픈소스 프레임워크 Harbor와 LangSmith로 구현하는 방법을 데이터 분석 에이전트 예제로 차근차근 설명한다.
핵심 내용 읽기 →
LangChain의 Ben Tanneyhill이 '에이전트 엔지니어를 위한 에이전트' Engine의 내부 구조를 설명한다. 서브에이전트 위임, 컨텍스트 압축, 셔도우 평가, 그리고 자기 자신을 개선하는 메타 루프까지.
핵심 내용 읽기 →
AI 에이전트가 실패 경험에서 배우되 기존 성능을 망가뜨리지 않는 '검증 가능한 지속 학습'의 개념과, 재현성·전체성·평생성·효율성 네 원칙을 RELAI 사례로 정리했다.
핵심 내용 읽기 →
데모에서 잘 도는 에이전트도 출시 후가 진짜 시작이다. 로그 모니터링·세션 분석·컴퓨터 유즈로 피드백 루프를 닫는 Wandero의 '메타 하네스' 운영 전략을 정리했다.
핵심 내용 읽기 →