AI 에이전트 평가 3대 벤치마크: METR 시간지평·GDPval 승률·딥스칼라벤치 한계
스탠퍼드 CS329A 강의가 METR 시간지평, GDPval, 딥스칼라벤치 세 벤치마크로 AI 에이전트의 실제 능력을 짚는다. 과제 길이는 7개월마다 두 배로 늘지만 신뢰도와 맥락이 여전히 병목이다.
핵심 내용 읽기 →AI TOPIC
GDPval 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

스탠퍼드 CS329A 강의가 METR 시간지평, GDPval, 딥스칼라벤치 세 벤치마크로 AI 에이전트의 실제 능력을 짚는다. 과제 길이는 7개월마다 두 배로 늘지만 신뢰도와 맥락이 여전히 병목이다.
핵심 내용 읽기 →
OpenAI 연구 리드 테잘 파트와르단이 벤치마크 포화, 벤치맥싱, 실제 업무를 재는 GDPval과 과학 실험 평가까지 AI 모델 평가가 어떻게 진화하는지 설명한다.
핵심 내용 읽기 →