커버리지 원리로 본 언어모델 학습, best-of-n 성능을 좌우하는 숨은 지표는 무엇인가
언어모델을 여러 번 샘플링해 답을 고르는 방식이 표준이 되면서, 학습 중 보는 크로스 엔트로피만으로는 실제 성능을 예측하기 어려워졌다. 카네기멜런대 세미나에서 제시된 '커버리지' 개념과 실험 결과를 정리했다.
핵심 내용 읽기 →AI TOPIC
테스트 타임 컴퓨트 관련 핵심 뉴스와 활용 인사이트 12편을 최신순으로 모았습니다.

언어모델을 여러 번 샘플링해 답을 고르는 방식이 표준이 되면서, 학습 중 보는 크로스 엔트로피만으로는 실제 성능을 예측하기 어려워졌다. 카네기멜런대 세미나에서 제시된 '커버리지' 개념과 실험 결과를 정리했다.
핵심 내용 읽기 →
구글 딥마인드 아르키트 샤르마가 ETH 취리히 초청 강연에서 정리한 추론 시점 연산 확장의 원리와 벤치마크 성과, 그리고 검증 데이터 고갈·지식 발견·장기 에이전트라는 남은 과제를 함께 소개합니다.
핵심 내용 읽기 →
오픈AI가 GPT-5.2로 여러 벤치마크 기록을 새로 썼지만 점수 상당 부분은 더 많은 사고 토큰을 쓴 결과였다. GDPval의 전문가 초월 주장, 비교 대상 선택, 비공개 벤치마크 결과까지 하나씩 짚어본다.
핵심 내용 읽기 →
오픈AI 노암 브라운은 모델이 얼마나 오래 생각했는지를 빼놓은 벤치마크가 성능도 위험도 잘못 보여준다고 말한다. 막대그래프 대신 연산량 축으로 다시 그려야 하는 이유와 그가 내놓은 세 가지 구체적 제안을 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS329A 7강 정리. 알파코드의 100만 개 대량 샘플링과 군집 선별, 알파코드2의 채점 모델, 그리고 추론 도중 스스로 검색을 호출하는 딥리서치 에이전트의 작동 원리와 한계를 함께 짚는다.
핵심 내용 읽기 →
추론 모델은 새로운 아키텍처가 아니라 훈련 방식에서 나왔다. 정답에만 보상을 주자 모델이 스스로 검증과 되짚기를 익힌 과정, 테스트 타임 컴퓨트라는 새 축, 그리고 환각률이 함께 올라간 부작용까지 정리했다.
핵심 내용 읽기 →
UC버클리 찰리 스넬이 딥마인드 인턴십에서 진행한 연구를 소개한다. LLM에 추론 시 계산을 더 쓰게 하는 검증기 기반 탐색과 순차 수정 방식이 문제 난이도와 예산에 따라 어떻게 확장되는지, 그리고 언제 모델 크기 키우기보다 나은지를 분석한다.
핵심 내용 읽기 →
오픈AI 연구자 노엄 브라운이 모델 출시마다 등장하는 벤치마크 표의 한계를 지적한다. 사고 시간을 통제하지 않은 점수 비교, 예산이 빠진 안전성 평가, 그리고 급격한 지능 폭발이 어려운 이유를 정리했다.
핵심 내용 읽기 →
오픈AI o1은 답하기 전 스스로 사고사슬을 돌리는 ‘테스트타임 컴퓨트’로 추론·수학 성능을 끌어올렸다. 사고사슬의 실제 효과, 그 한계, 그리고 딥마인드가 밝힌 사전학습과의 비교까지 최신 논문들로 정리한다.
핵심 내용 읽기 →
이론물리학 출신 오픈AI 연구자 댄 로버츠가 강화학습의 원리, 탐색과 활용, 테스트타임 컴퓨트, 그리고 AI가 미해결 수학 문제를 푸는 방식까지 쉽게 풀어냈다.
핵심 내용 읽기 →
요즘 주목받는 추론(생각하는) LLM이 어떻게 더 나은 답을 내는지, 사고 사슬·테스트 타임 컴퓨트·best-of-N·검증 가능한 보상 강화학습을 통해 풀어 설명합니다.
핵심 내용 읽기 →
모델을 키우는 학습타임 컴퓨트 외에, 답할 때 연산을 더 쓰는 테스트타임 컴퓨트가 새로운 확장 축으로 떠올랐다. 사고 토큰·탐색·자기일관성의 원리와 비용 트레이드오프를 정리했다.
핵심 내용 읽기 →