Senior SWE-Bench: 시니어 개발 과제로 코딩 AI 에이전트를 평가하는 벤치마크
실제 시니어 엔지니어의 PR을 바탕으로 저사양 지시문과 검증 에이전트를 결합해 코딩 AI를 평가하는 Snorkel AI의 Senior SWE-Bench가 어떻게 설계됐고, 리더보드에서 무엇이 드러났는지 정리한다.
핵심 내용 읽기 →AI TOPIC
SWE-Bench 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

실제 시니어 엔지니어의 PR을 바탕으로 저사양 지시문과 검증 에이전트를 결합해 코딩 AI를 평가하는 Snorkel AI의 Senior SWE-Bench가 어떻게 설계됐고, 리더보드에서 무엇이 드러났는지 정리한다.
핵심 내용 읽기 →
스탠퍼드 CME295 강의를 바탕으로 LLM 평가법을 정리한다. 사람 평가와 규칙 기반 지표의 한계, LLM-as-a-Judge와 편향, MMLU·SWE-bench 등 벤치마크와 데이터 오염 문제를 다룬다.
핵심 내용 읽기 →