AI 코딩 평가의 한계: 벤치마크 오염, 정답과 논증의 격차, 그리고 남은 네 가지 과제
MIT 박사과정 알렉스 구가 CRUXEval·LiveCodeBench·IneqMath에서 얻은 관찰을 통해, 리더보드 숫자가 감추는 오염과 논증 능력의 공백, 그리고 코딩 AI 평가에 남은 과제를 정리했다.
핵심 내용 읽기 →AI TOPIC
수학 추론 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

MIT 박사과정 알렉스 구가 CRUXEval·LiveCodeBench·IneqMath에서 얻은 관찰을 통해, 리더보드 숫자가 감추는 오염과 논증 능력의 공백, 그리고 코딩 AI 평가에 남은 과제를 정리했다.
핵심 내용 읽기 →
딥시크 R1의 핵심 요소인 GRPO를 딥시크매스 논문으로 짚는다. 커먼크롤에서 1200억 토큰 수학 코퍼스를 반복 선별하고, 가치 모델 대신 그룹 표본의 평균·표준편차로 이점을 계산해 7B 모델을 상위권에 올렸다.
핵심 내용 읽기 →