SWE-bench 개발자가 직접 말하는 코딩 AI 평가의 현재: 통과율 10%에서 80%까지의 3년
깃허브 이슈를 그대로 문제로 삼는 평가 도구 SWE-bench를 만든 연구자가 벤치마크 제작 과정과 에이전트 도구 설계, 학습용 문제의 대량 생성까지 3년간의 작업을 직접 설명한 온라인 세미나의 내용을 정리했다.
핵심 내용 읽기 →AI TOPIC
AI 벤치마크 관련 핵심 뉴스와 활용 인사이트 44편을 최신순으로 모았습니다.

깃허브 이슈를 그대로 문제로 삼는 평가 도구 SWE-bench를 만든 연구자가 벤치마크 제작 과정과 에이전트 도구 설계, 학습용 문제의 대량 생성까지 3년간의 작업을 직접 설명한 온라인 세미나의 내용을 정리했다.
핵심 내용 읽기 →
MIT 박사과정 알렉스 구가 CRUXEval·LiveCodeBench·IneqMath에서 얻은 관찰을 통해, 리더보드 숫자가 감추는 오염과 논증 능력의 공백, 그리고 코딩 AI 평가에 남은 과제를 정리했다.
핵심 내용 읽기 →
옥스퍼드 연구진이 짧은 문제를 사슬처럼 이어 붙여 AI의 장기 추론을 훈련하고 측정한 결과를 공개했다. 최신 모델도 정답률 10%를 넘지 못한 벤치마크와, 단계 길이를 조금씩 늘리는 커리큘럼 강화학습의 효과를 정리했다.
핵심 내용 읽기 →
UC 버클리와 xAI 소속 연구자가 발표한 생성형 AI 세미나 내용을 정리한다. 데이터 고갈에 대비한 데이터 재사용·엔드투엔드·분산 협업 전략과, 장기 계획·그라운딩·비용에서 드러난 AI 에이전트의 한계를 짚는다.
핵심 내용 읽기 →
UC 버클리 연구자가 발표한 지속 학습 벤치마크는 상태를 유지한 시스템과 매번 기억을 지운 시스템의 점수 차이를 '게인'으로 측정한다. 문제마다 독립적으로 채점하는 기존 리더보드가 감춰 온 학습 능력을 드러내려는 시도다.
핵심 내용 읽기 →
MIT 미디어랩 AHA 프로그램의 연례 심포지엄 현장 정리. 10대의 챗봇 사용 실태와 공감을 흉내 내는 대화형 AI의 위험, 그리고 사람에게 미치는 영향을 재는 공개 벤치마크와 AI 영양성분표 같은 대안까지 짚었다.
핵심 내용 읽기 →
연구자가 논문 작성과 아이디어 구상에까지 LLM을 쓰는 지금, 객관식 정답률만으로는 신뢰를 확인할 수 없다. 문제를 다섯 단계 사슬로 쪼개고 근거와 힌트 반응까지 채점한 물리 벤치마크 설계를 살펴본다.
핵심 내용 읽기 →
서울대 DSBA 연구실 세미나를 바탕으로 코딩 에이전트를 채점하는 SWE-bench·Terminal-Bench·RExBench의 설계와 한계, 벤치마크가 1년도 못 버티고 포화되는 이유, 그리고 모델과 실행 하네스를 분리해 측정해야 하는 까닭을 정리했다.
핵심 내용 읽기 →
스탠퍼드 HAI 세미나에서 산미 코예조 교수는 AI 벤치마크가 설계 목적을 넘어 정책과 투자 판단에 쓰이면서 측정의 위기가 왔다고 진단했다. 타당도 다섯 갈래와 문항반응이론을 활용한 평가 개선안을 제시한다.
핵심 내용 읽기 →
AI가 세계에 대한 내부 모델을 갖는지 확인하려면 무엇을 시험해야 할까. 연구자는 도시 산책 영상으로 만든 공간 추론 벤치마크와 동물 동작 예측 실험을 통해 현재 모델이 잘하는 일과 못하는 일을 갈라 보여 준다.
핵심 내용 읽기 →
METR 연구자 데이비드 라인이 '시간 지평' 지표를 해설한다. 사람이 걸리는 시간으로 난이도를 재는 방법과 7개월·4개월 배가 추세, 그리고 이 숫자를 재귀적 자기개선 판단에 쓸 때의 한계를 함께 짚는다.
핵심 내용 읽기 →
2026년 들어 AGI 전망이 급격히 앞당겨졌다. 매출 급증과 METR 시간 지평선, 앤스로픽의 내부 가속 지표를 하나씩 검증하고, 카페와 상점 운영 실험이 드러낸 반대 근거와 남은 불확실성까지 함께 짚는다.
핵심 내용 읽기 →
오픈AI 노암 브라운은 모델이 얼마나 오래 생각했는지를 빼놓은 벤치마크가 성능도 위험도 잘못 보여준다고 말한다. 막대그래프 대신 연산량 축으로 다시 그려야 하는 이유와 그가 내놓은 세 가지 구체적 제안을 정리했다.
핵심 내용 읽기 →
평가 도구는 왜 전부 무료일까. 허깅페이스 파리 본사를 찾아간 개발자 채널이 세 직원에게 벤치마크 조작을 막는 게이팅과 롤링 데이터, 로봇 센서 데이터 수집, 회사의 수익 모델과 일하는 방식을 물었다.
핵심 내용 읽기 →
AI를 만드는 속도가 그것을 재는 속도를 앞질렀다. 스노클 AI 연구자가 버클리 에이전틱 AI 서밋에서 밝힌, 오래 쓰이는 에이전트 벤치마크의 설계 원칙과 과제 품질 관리 방법, 다음 세대 평가의 방향을 정리했다.
핵심 내용 읽기 →
마이크로소프트 리서치 인도 학술 서밋의 멀티모달·체화 지능 세션 정리. 시각 지각만 떼어내 측정한 진단 벤치마크와 라벨 없는 소형 모델 강화, 영상 속 인물 추적, 의료 영상 판독 연구가 차례로 이어졌다.
핵심 내용 읽기 →
마인크래프트에서 LLM 에이전트를 움직이는 오픈소스 프로젝트 MINDcraft가 심사 중인 학술 논문으로 정리됐다. 재료를 나눠 가진 봇들이 대화로 협력해 아이템을 만들고 요리하고 건축하는 과제로 모델의 협업 능력을 비교한다.
핵심 내용 읽기 →
모델 발표마다 쏟아지는 벤치마크 점수가 실제 사용 경험과 어긋나는 이유를 제작 비용, 학습 데이터 오염, 리워드 해킹, 허술한 채점기 같은 구체적 실패 유형으로 짚고 개선 방향까지 정리했다.
핵심 내용 읽기 →
AI가 생물학 벤치마크에서 인간 전문가를 앞지르기 시작했다. SecureBio는 최전선 연구에서 과제를 가져오고 전문가 합의 대신 실제 실험 결과가 정답을 정하게 하는 방식으로 이 한계를 넘으려 한다.
핵심 내용 읽기 →
GLM-4.5와 Kimi K2가 2주 사이 쏟아지며 오픈모델의 표준이 중국 쪽으로 기울고 있다. 전 라마 추론 리드 로스 테일러는 인재 신화보다 자원 배분과 평가 설계가 모델 품질을 가른다고 말한다.
핵심 내용 읽기 →
26분 간격으로 공개된 두 최상위 모델의 250쪽 분량 리포트를 직접 읽은 분석이다. 회사마다 다른 벤치마크를 골라 발표해 비교가 막혀 있고, 가장 유용한 모델이 가장 신뢰할 만한 모델은 아니라는 결론에 이른다.
핵심 내용 읽기 →
SWE-bench를 만든 존 양이 새 벤치마크 프로그램벤치를 내놨다. 구현 과정 대신 완성된 실행 파일만 평가하는 설계, 출시 당시 0%였던 성적, 인터넷을 열었을 때 드러난 보상 해킹 문제까지 인터뷰에서 짚은 내용을 정리했다.
핵심 내용 읽기 →
서울대 문병로 교수가 트랜스포머를 관계 추구의 정점으로 설명하고, 자체 알고리즘 시험으로 LLM을 채점한 결과와 앞으로 3년의 버티컬 AI 전망을 정리했다.
핵심 내용 읽기 →
Z.AI가 GLM 5.2의 가중치를 공개했다. 독립 벤치마크에서 이전 버전 대비 도약이 크고 상위권에 소수 상용 모델만 남았다. 긴 사고 사슬로 인한 토큰 사용량, 100만 토큰당 가격, 데이터 전송 선택권까지 짚었다.
핵심 내용 읽기 →
많은 AI 벤치마크는 모델이 인터넷에서 본 패턴을 알아본 것인지, 새로 추론해 낸 것인지 구분하지 못한다. ARC-AGI 3는 아무 설명 없는 게임형 환경에 에이전트를 놓고 규칙과 목표를 스스로 찾아내게 하며, 상금 200만 달러가 걸려 있다.
핵심 내용 읽기 →
제미나이 3.1 프로는 여러 벤치마크에서 최고 점수를 냈지만 다른 평가에선 뒤처졌다. 사후학습 특화가 만든 이 모순과 환각·지름길 문제를 정리했다.
핵심 내용 읽기 →
LLM에게 다른 LLM의 답변을 채점하게 하는 방식은 얼마나 믿을 만할까. 22개 유형의 오류를 일부러 심어 평가자 모델을 시험한 FBI 프레임워크 연구 결과를 정리했다.
핵심 내용 읽기 →
딥시크 R1 이후 추론 모델 연구는 어디까지 왔을까. 추론 학습이 정말 새로운 능력을 여는지를 둘러싼 최근 논쟁과, 각 사가 고른 벤치마크에서 드러나는 오픈AI·구글·메타의 서로 다른 지향을 현업 AI 연구자와 함께 짚었다.
핵심 내용 읽기 →
데이터커브가 만든 코딩 벤치마크 DeepSWE는 기존 문제를 공개 저장소에서 긁어오지 않는다. AI 모델이 깃 기록에서 정답을 찾아내는 커닝 문제와 모델별 성향 차이를 정리했다.
핵심 내용 읽기 →
옥스퍼드 AI 연구진의 발표를 정리했다. 창업자 프로필만으로 성공을 예측하는 벤치마크 VCBench와, 무엇을 물을지·언제 멈출지를 배우는 비용 인식 강화학습 에이전트, 그리고 데이터 오염을 막는 익명화 기법까지 다룬다.
핵심 내용 읽기 →
3Blue1Brown의 그랜트 샌더슨이 AI의 수학 진전을 짚는다. 점수로 잴 수 없는 추측과 정의 만들기, 갈루아의 100년 검증 루프, 검증 가능성 너머의 반복 가능성과 린의 역할, 수학자의 역할 변화까지 다룬다.
핵심 내용 읽기 →
허깅페이스 토마스 울프와 보안 스타트업 아리스메틱이 공개한 접근제어 벤치마크는 연구팀이 직접 발굴한 제로데이 취약점으로 모델의 논리적 추론을 시험한다. 공격이 빨라진 시대에 방어가 앞서려면 무엇이 필요한지 짚어본다.
핵심 내용 읽기 →
문샷 AI의 키미 K3가 공개 모델 가운데 최대 규모로 등장했다. 토큰당 16개만 켜지는 전문가 혼합 구조와 코드 아레나 1위 기록, 그리고 환각률과 자체 측정 방식을 둘러싼 논란까지 함께 정리했다.
핵심 내용 읽기 →
가중치가 공개된 중국산 대형 모델이 프런트엔드 코딩 평가에서 상용 최상위 모델을 큰 격차로 앞질렀습니다. 2.8조 파라미터라는 규모와 토큰 단가, 작업당 실제 비용, 그리고 이 벤치마크 결과를 그대로 믿기 어려운 이유까지 함께 정리했습니다.
핵심 내용 읽기 →
OpenAI가 GPT-5.6을 공개했다. Soul·Terra·Luna 3종 구성과 코덱스 데스크톱 앱, 실제 코딩·연구 과제 시험 결과, 그리고 벤치마크와 한계를 정리했다.
핵심 내용 읽기 →
세 곳의 프런티어 AI 연구소가 하루 사이 새 모델을 쏟아냈다. GPT-5.6 소울과 그록 4.5, 메타 뮤즈가 벤치마크와 비용에서 어떻게 갈렸는지, 영상 분석을 토대로 정리했다.
핵심 내용 읽기 →
버그 수정을 넘어 프로젝트 전체를 맡기는 시대, 코딩 에이전트를 수 시간·수억 토큰 규모로 평가하는 SWE-Marathon 벤치마크와 검증(verification)의 중요성을 정리했다.
핵심 내용 읽기 →
구글 제미나이 3 프로가 인류 최후의 시험·GPQA·ARC-AGI 등 20여 개 벤치마크에서 세운 기록과, 자체 TPU·사전학습 확장이라는 배경, 코딩·환각·안전성의 한계까지 짚었다.
핵심 내용 읽기 →
새 AI 모델 발표 때 등장하는 MMLU·GPQA·HumanEval 같은 숫자의 의미를 풀이한다. 각 벤치마크가 무엇을 측정하는지, 퓨샷이 무엇인지, 점수를 어떻게 비교하고 직접 돌려보는지까지 차근차근 정리했다.
핵심 내용 읽기 →
AI Explained가 클로드 오퍼스 4.7의 벤치마크 성적과 적응형 사고 기본값, 컴퓨트 부족 논란, 앤트로픽과 오픈AI의 오랜 경쟁 구도를 정리한다. 모델 능력을 하나의 지표로 재기 어렵다는 점을 짚는다.
핵심 내용 읽기 →
OpenAI의 GPT-5.4가 화이트칼라 업무에서 보인 성과와 환각·들쭉날쭉한 성능의 한계, 그리고 앤트로픽이 국방 계약을 둘러싸고 OpenAI와 충돌한 논란까지 정리했다.
핵심 내용 읽기 →
319페이지에 달하는 Claude Fable 5 시스템 카드에서 놓치기 쉬운 핵심 20여 가지를 정리한다. 벤치마크 우위와 함께 생물학 능력, 평가 인식, 프로덕션 오류 등 그늘도 짚는다.
핵심 내용 읽기 →
약 20시간 사이 공개된 OpenAI GPT-5.5와 중국 DeepSeek V4를 벤치마크·비용·환각률·사이버보안 관점에서 비교하고, 업계 전반의 컴퓨트 부족 문제를 짚는다.
핵심 내용 읽기 →
구글 I/O에서 공개된 제미나이 옴니와 3.5 플래시를 짚고, 월드 모델과 추론 모델로 갈리는 AGI 경로 논쟁, 그리고 모델의 ‘들쭉날쭉함’ 문제를 정리한다.
핵심 내용 읽기 →