장기 추론 벤치마크 LongCoT와 커리큘럼 강화학습, AI가 긴 작업에 약한 이유
옥스퍼드 연구진이 짧은 문제를 사슬처럼 이어 붙여 AI의 장기 추론을 훈련하고 측정한 결과를 공개했다. 최신 모델도 정답률 10%를 넘지 못한 벤치마크와, 단계 길이를 조금씩 늘리는 커리큘럼 강화학습의 효과를 정리했다.
핵심 내용 읽기 →AI TOPIC
커리큘럼 학습 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

옥스퍼드 연구진이 짧은 문제를 사슬처럼 이어 붙여 AI의 장기 추론을 훈련하고 측정한 결과를 공개했다. 최신 모델도 정답률 10%를 넘지 못한 벤치마크와, 단계 길이를 조금씩 늘리는 커리큘럼 강화학습의 효과를 정리했다.
핵심 내용 읽기 →
딥러닝논문읽기모임이 소개한 VCRL은 롤아웃 정답률의 분산으로 문제 난이도를 재고 메모리 뱅크로 좋은 문제를 재활용해, LLM 수학 추론 강화학습의 표본 효율과 학습 안정성을 함께 끌어올린 방법이다.
핵심 내용 읽기 →