RAG 검색 2단계와 툴 호출, 에이전트 루프까지 스탠퍼드 CME295 7강 핵심 정리
스탠퍼드 CME295 7강은 학습 시점에 갇힌 LLM을 외부 세계와 잇는 방법을 다룬다. RAG의 후보 검색과 재랭킹, 검색 품질 지표, 함수 호출 3단계, ReAct 에이전트 루프와 안전 문제까지 짚었다.
핵심 내용 읽기 →AI TOPIC
스탠퍼드 강의 관련 핵심 뉴스와 활용 인사이트 17편을 최신순으로 모았습니다.

스탠퍼드 CME295 7강은 학습 시점에 갇힌 LLM을 외부 세계와 잇는 방법을 다룬다. RAG의 후보 검색과 재랭킹, 검색 품질 지표, 함수 호출 3단계, ReAct 에이전트 루프와 안전 문제까지 짚었다.
핵심 내용 읽기 →
스탠퍼드 초청 강연에서 연구자가 골든게이트 클로드로 알려진 스티어링부터 인과 매개 분석과 인과 추상화까지, 신경망 내부를 인과로 규명하는 방법을 단계별로 설명했다. 각 방법이 실제로 무엇을 증명하는지도 짚는다.
핵심 내용 읽기 →
스탠퍼드 CME295 강의 첫 시간이 텍스트를 숫자로 바꾸는 토큰화에서 출발해 워드투벡 임베딩과 RNN·LSTM의 한계를 거쳐 트랜스포머의 셀프 어텐션과 인코더·디코더 구조에 이르는 개념의 흐름을 차례로 짚는다.
핵심 내용 읽기 →
같은 절벽 앞에서 SARSA는 안전한 길을, Q러닝은 최단 경로를 택한다. 스탠퍼드 AA203 강의를 따라 두 알고리즘을 가르는 온폴리시와 오프폴리시의 차이부터, 가치 함수 근사와 DQN을 실제로 굴러가게 만든 두 장치까지 짚었다.
핵심 내용 읽기 →
스탠퍼드 AA203 18강은 가치 함수를 거치지 않고 정책 자체를 직접 최적화하는 정책 경사를 다룬다. 리인포스 알고리즘의 유도, 높은 분산 문제, 인과성과 베이스라인을 통한 분산 감소, 액터-크리틱과 어드밴티지 함수까지 정리했다.
핵심 내용 읽기 →
스탠퍼드 AA203 강의가 모델 예측 제어의 두 축을 정리했다. 종단 집합을 제어 불변 집합으로 잡으면 매 제어 주기마다 해의 존재가 보장되고, 최적 비용 함수를 리아푸노프 함수로 삼으면 안정성 증명이 따라온다.
핵심 내용 읽기 →
스탠퍼드 AA203 강의가 해밀턴-야코비-아이작스 방정식으로 충돌 회피용 안전 집합을 계산하는 방법과, 개루프의 속도와 폐루프의 강점을 절충하는 모델예측제어의 구조 및 세 가지 튜닝 손잡이를 함께 정리한다.
핵심 내용 읽기 →
스탠퍼드 AA203 13강은 동역학을 안다는 가정을 내려놓는 자리다. 불확실성에 대응하는 세 갈래 전략, 최소자승 시스템 식별의 성질과 한계, 그리고 리아푸노프 안정성으로 전개되는 적응 제어의 논리를 정리했다.
핵심 내용 읽기 →
스탠퍼드 AA203 6강이 다룬 직접법을 정리했다. 시간을 먼저 이산화해 일반 최적화 문제로 바꾸는 슈팅과 콜로케이션, 그리고 비선형 문제를 볼록 문제의 반복으로 푸는 순차 볼록 계획법이 핵심이다.
핵심 내용 읽기 →
스탠퍼드 AA203 최적제어 3강 정리. 부등식 제약을 활성 제약으로 걸러 KKT 조건을 세우고, 제어 신호 전체를 찾는 무한차원 문제를 변분법으로 다뤄 오일러 방정식에 도달하는 과정을 한국어로 풀어 설명합니다.
핵심 내용 읽기 →
스탠퍼드 최적·학습 기반 제어 강의 2강은 기울기가 0이라는 최적성 필요조건과 헤세 행렬 조건, 볼록 함수의 이점, 경사법의 방향과 보폭 선택, 그리고 등식 제약을 다루는 라그랑주 승수 정리를 차례로 짚는다.
핵심 내용 읽기 →
스탠퍼드 AA203 최적·학습 기반 제어 5강 요약. 제어 입력에 상한이 있을 때 최적성 조건이 폰트랴긴 최소 원리로 어떻게 강화되는지, 최소 시간·연료·에너지 문제에서 나오는 제어 형태와 수치 해법을 정리했습니다.
핵심 내용 읽기 →
스탠퍼드 AA203 첫 강의는 안정성과 추종만 다루는 고전 제어에 성능 기준, 기준 신호를 만드는 계획, 모델을 데이터로 배우는 학습이 빠져 있다고 짚고, 개루프와 폐루프 제어에서 MPC와 강화학습까지 한 학기 지도를 펼쳐 보인다.
핵심 내용 읽기 →
스탠퍼드 CS329A 강의가 다룬 LATS, SPRINT, SWiRL 세 논문을 정리했다. 트리 탐색으로 계획을 고르고, 독립적인 단계를 병렬로 돌리고, 도구 사용을 강화학습으로 가르쳐 AI 에이전트의 계획 능력을 끌어올리는 방법을 짚는다.
핵심 내용 읽기 →
스탠퍼드 CS329A 6강은 모델이 스스로 만든 답 중 정답만 걸러 다시 학습시키는 학습 시간 스케일링을 STaR, GRPO, DAPO 세 논문으로 짚으며, 7B와 32B급 작은 모델이 수학 추론에서 앞선 이유를 설명한다.
핵심 내용 읽기 →
스탠퍼드 CS329A 7강 정리. 알파코드의 100만 개 대량 샘플링과 군집 선별, 알파코드2의 채점 모델, 그리고 추론 도중 스스로 검색을 호출하는 딥리서치 에이전트의 작동 원리와 한계를 함께 짚는다.
핵심 내용 읽기 →
오늘날 거의 모든 대형 AI 모델은 트랜스포머다. 스탠퍼드 CS231N 강의를 토대로, 순환 신경망의 고정 길이 병목을 고치려던 어텐션이 어떻게 독립적인 연산이 되고 트랜스포머로 이어졌는지 정리했다.
핵심 내용 읽기 →