AI 벤치마크는 무엇을 측정하나: 구성 타당도와 문항반응이론으로 다시 보는 AI 평가 과학
스탠퍼드대 산미 코예조 교수가 AI 평가 공개 세미나에서 벤치마크 점수의 한계를 짚었다. 실험실과 배포 환경 사이의 간극, 심리측정학이 먼저 겪은 위기, 문항반응이론을 활용한 평가 비용 절감까지 핵심을 정리했다.
핵심 내용 읽기 →AI TOPIC
심리측정학 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

스탠퍼드대 산미 코예조 교수가 AI 평가 공개 세미나에서 벤치마크 점수의 한계를 짚었다. 실험실과 배포 환경 사이의 간극, 심리측정학이 먼저 겪은 위기, 문항반응이론을 활용한 평가 비용 절감까지 핵심을 정리했다.
핵심 내용 읽기 →
정답 개수만 세는 LLM 벤치마크의 한계를 심리측정학의 문항반응이론(IRT)으로 넘어서는 방법. 문항 난이도·변별력·모델 지능을 함께 추정해 평가를 정교하게 만든다.
핵심 내용 읽기 →
단일 정확도 대신 심리측정학의 문항반응이론(IRT)으로 LLM을 평가하는 방법. 문항 난이도·변별도와 모델 능력을 따로 추정해 벤치마크 감사, 데이터 유출 탐지, 모델 증류 여부까지 밝혀낸다.
핵심 내용 읽기 →