터미널 벤치로 본 AI 에이전트 평가의 현재 실력과 앞으로 5년의 핵심 과제 정리
AI 평가의 관심사는 무엇을 아는가에서 무엇을 할 수 있는가로 옮겨갔다. 과제마다 전용 도커 환경을 주고 에이전트를 시험하는 터미널 벤치의 설계와, 최고 모델도 50%를 넘지 못하는 이유를 정리했다.
핵심 내용 읽기 →AI TOPIC
LLM 평가 관련 핵심 뉴스와 활용 인사이트 59편을 최신순으로 모았습니다.

AI 평가의 관심사는 무엇을 아는가에서 무엇을 할 수 있는가로 옮겨갔다. 과제마다 전용 도커 환경을 주고 에이전트를 시험하는 터미널 벤치의 설계와, 최고 모델도 50%를 넘지 못하는 이유를 정리했다.
핵심 내용 읽기 →
GPT-4가 디버거를 스스로 다뤄 보안 문제를 풀어내는 장면에서 출발한 프로젝트다. CTF 문제를 도커 컨테이너로 재현해 LLM의 사이버 공격 능력을 측정하는 벤치마크의 설계와, 그 과정에서 드러난 함정들을 정리했다.
핵심 내용 읽기 →
MIT 박사과정 알렉스 구가 CRUXEval·LiveCodeBench·IneqMath에서 얻은 관찰을 통해, 리더보드 숫자가 감추는 오염과 논증 능력의 공백, 그리고 코딩 AI 평가에 남은 과제를 정리했다.
핵심 내용 읽기 →
로스쿨 시험 340개에서 뽑은 문항으로 대형 언어 모델 26개를 평가한 LEXam 연구 발표를 정리했다. 오답 보기를 늘리기만 해도 정확도가 절반으로 떨어졌고, 추론 시간을 늘려도 성능은 나아지지 않았다.
핵심 내용 읽기 →
메타 인턴십에서 나온 연구다. 실험을 끝까지 실행시키는 대신 논문 8천 편에서 추출한 채점 루브릭을 보상으로 삼아 연구 계획을 세우는 능력만 강화학습으로 끌어올렸고, 대학원생과 현업 연구자가 참여한 인간 평가에서도 개선이 확인됐다.
핵심 내용 읽기 →
어도비 제품보안 엔지니어 두 명이 사내 보안 가이드를 하나의 벡터 스토어로 모아 지라·슬랙·IDE 어디서든 같은 답을 주는 시스템을 만든 과정을 공개했다. 문서 수집 자동화와 평가 체계가 핵심이었다.
핵심 내용 읽기 →
앨런AI연구소 연구진이 GRE·SAT 같은 시험이 쓰는 문항반응이론을 LLM 벤치마크에 적용했다. 모델 실력에 맞춰 문항을 골라 가는 유동적 벤치마킹은 50문항만으로 무작위 500문항보다 나은 평가 품질을 냈다고 한다.
핵심 내용 읽기 →
생물·사이버·화학 공격에 쓰일 수 있는 지식을 간접 측정하는 WMDP 벤치마크와, 일반 지식과 대화 능력은 지키면서 위험 지식만 잊게 하는 RMU 언러닝 기법을 연구자가 실험 결과와 남은 과제까지 직접 설명했다.
핵심 내용 읽기 →
결제 회사 스트라이프의 보안 엔지니어들이 위협 모델링과 보안 문의 라우팅에 AI 에이전트를 투입하며 겪은 환각 문제, 정답이 없는 작업을 채점하는 LLM 평가 파이프라인 구축 과정, 그리고 마지막 확인을 사람에게 남긴 이유를 정리했다.
핵심 내용 읽기 →
AI 모델이 평가에서 일부러 실력을 감추는 샌드배깅을 어떻게 잡아낼까. 아파트 리서치와 아폴로 리서치가 연 기만 탐지 해커톤의 수상작들이 가중치 노이즈부터 응답 메타데이터까지 서로 다른 해법을 내놓았다.
핵심 내용 읽기 →
기계공학 출신 연구자가 AI 안전 분야로 옮겨 해커톤 참여에서 논문 투고까지 나아간 과정을 정리했다. 벤치마크 데이터 오염의 실제 영향을 측정한 연구와, 기회가 부족한 분야에서 스스로 기회를 만드는 방법을 다룬다.
핵심 내용 읽기 →
일리노이대 가간딥 싱 교수가 응답 몇 개를 뽑아 보는 현행 AI 안전성 평가의 한계를 지적하고, 위험한 출력이 나올 확률의 상하한을 직접 계산하는 형식 검증 기법과 에이전트 제약 강제 사례를 소개했다.
핵심 내용 읽기 →
AI가 사람이 검토할 수 있는 속도보다 빠르게 코드를 쏟아내는 상황에서, 텍사스대 오스틴 연구진이 파라미터를 고정한 LLM의 은닉 상태만으로 품질 점수를 매기는 경량 회귀 기법 RELISH를 제안했다. 학습과 추론 비용도 함께 낮췄다.
핵심 내용 읽기 →
NSF-Simons 코스믹AI 세미나에서 공개된 MCP 서버 MANNA를 정리했다. 스키마가 제각각인 천문 아카이브를 LLM이 다루게 만든 설계와, 그 효과를 직접 만든 평가 프레임워크로 측정한 과정을 다룬다.
핵심 내용 읽기 →
라케라 소속 연구자가 ICLR 2026 논문 'Breaking Agent Backbones'를 소개했다. 에이전트 작업을 한 단계씩 잘라 공격을 주입하는 '위협 스냅샷' 기법으로 백본 LLM 30여 종의 보안성을 비교한 결과와, 그 점수를 읽을 때 주의할 점을 정리한다.
핵심 내용 읽기 →
스탠퍼드 HELM 연구자가 3년 넘게 대규모 모델 평가를 운영하며 확인한 문제를 정리한다. 벤치마크 포화, 공개되지 않는 원본 평가 로그, 프롬프트 문구와 입력 형식만 바꿔도 모델 순위가 뒤집히는 재현성 문제를 다룬다.
핵심 내용 읽기 →
GPT-4가 사람 대신 챗봇 답변을 채점하면 인간 평가자와 85% 일치했다. MT-Bench와 챗봇 아레나를 제안한 LLM-as-a-Judge 논문이 밝힌 평가 방식 세 가지와 위치·장황함·자기선호 편향, 그리고 그 완화책을 정리했다.
핵심 내용 읽기 →
대학 LLM 강의의 평가 회차를 정리했다. 퍼플렉시티와 MMLU·GPQA 같은 시험형 벤치마크, 챗봇 아레나의 사람 선호 평가, SWE-bench 등 에이전트 벤치마크의 원리를 짚고 포화·데이터 오염·리더보드 착시 문제까지 살펴본다.
핵심 내용 읽기 →
스터디 발표 영상을 바탕으로 한국어 소형 LLM을 Text-to-SQL 과제에 파인튜닝하는 과정을 정리했다. 데이터 구성과 LoRA 학습, LLM에게 채점을 맡기는 평가 파이프라인의 실무적인 걸림돌을 함께 다룬다.
핵심 내용 읽기 →
뉴욕대에서 열린 문화 AI 학술대회 세션 기록. 생성형 AI를 전통의 기계화로 보는 통계학자의 분석, 논문 동료심사를 AI에 맡기려는 흐름에 대한 반론, 문체 평가에 나타난 귀속 편향 실험을 담았다.
핵심 내용 읽기 →
연구자가 논문 작성과 아이디어 구상에까지 LLM을 쓰는 지금, 객관식 정답률만으로는 신뢰를 확인할 수 없다. 문제를 다섯 단계 사슬로 쪼개고 근거와 힌트 반응까지 채점한 물리 벤치마크 설계를 살펴본다.
핵심 내용 읽기 →
서울대 DSBA 연구실 세미나를 바탕으로 코딩 에이전트를 채점하는 SWE-bench·Terminal-Bench·RExBench의 설계와 한계, 벤치마크가 1년도 못 버티고 포화되는 이유, 그리고 모델과 실행 하네스를 분리해 측정해야 하는 까닭을 정리했다.
핵심 내용 읽기 →
AI 안전 포럼 2026 발표 정리. 진술의 강도를 일곱 단계로 바꾼 '사다리'를 만들어 16개 모델의 선호를 시험했다. 짝 비교 정답률은 약 97%였지만 단조성은 무너졌고, 종교와 개인의 자유 범주에서 비정합성이 특히 두드러졌다.
핵심 내용 읽기 →
모델 카드에 적힌 벤치마크 점수는 왜 서로 비교하기 어려울까. 엔비디아 평가 팀 매니저가 파이토치 콘퍼런스 유럽에서 공개한 LLM 평가의 함정, 나쁜 관행, 재현 가능한 측정 방법과 에이전트 평가의 과제를 정리했다.
핵심 내용 읽기 →
스탠퍼드 연구팀이 만든 터미널벤치는 실무자가 직접 겪은 문제 80개를 각각 독립된 도커 환경에 담은 고난도 에이전트 벤치마크다. 공개 당시 최고 성적 50%, 반복되는 실패 유형과 스캐폴드가 점수에 미치는 영향을 정리했다.
핵심 내용 읽기 →
프롬프트에 전문가 역할을 넣은 답과 넣지 않은 답 1,140건을 비교하니 총점 차이는 0.008에 그쳤다. 전문성 깊이는 올랐지만 명료성이 더 크게 떨어졌고, 조언형과 개념형 질문에서 순위가 뒤집혔다.
핵심 내용 읽기 →
지시를 몇 개까지 넣을 수 있는지, 마크다운이 정말 더 나은지, 긴 맥락에서 무엇이 먼저 무너지는지를 다섯 개 모델과 1만 회가 넘는 호출로 잰 통제 실험 논문입니다. 결론은 환각이 아니라 답변 거부였습니다.
핵심 내용 읽기 →
바이츠만 연구소와 ETS 연구진이 고교 생물 서술형 답안으로 AI 채점을 검증했다. 만점·빵점 답안은 사람만큼 정확했지만 4~7점 구간에서는 48개 결과 중 47개가 기준에서 두 범주 넘게 어긋났다.
핵심 내용 읽기 →
서울대 DSBA 연구실 세미나가 화학·물리 분야에서 움직이는 AI 에이전트를 다룬 논문 세 편을 정리했다. 최종 답이 아니라 도구 선택과 추론 과정을 분해해 평가해야 하는 이유, 그리고 언어 모델을 심판으로 쓸 때의 한계를 짚는다.
핵심 내용 읽기 →
정확도나 평균제곱오차 같은 지표가 통하지 않는 챗봇은 어떻게 평가할까. 단어 수를 세는 단위 테스트에서 시작해 어조를 판정하는 심판 LLM, 대화 전체 채점까지 이어지는 세 단계와 사람 라벨로 심판을 보정하는 방법을 정리했다.
핵심 내용 읽기 →
개발 중 20~30%였던 터미널벤치2 점수는 최근 제출에서 75%까지 올랐다. 제작자 알렉스 쇼가 벤치마크를 표준으로 만드는 조건과 과제 품질을 지키는 방법, 그리고 다음 병목인 검증자 자동화를 이야기했다.
핵심 내용 읽기 →
AI는 코딩과 수학에서 앞서갔지만 디자인과 글쓰기에서는 여전히 뒤처져 있다. 테이스트 랩스 창업자가 주관적 영역을 검증 가능한 형태로 쪼개는 방법과, 결과물이 밋밋해지는 구조적 원인인 '평균으로의 붕괴'를 설명했다.
핵심 내용 읽기 →
서울대 DSBA 연구실 세미나가 웹아레나와 OS월드 두 벤치마크를 정리했다. GPT-4의 성공률은 각각 14.41%와 12.24%로, 같은 과제를 수행한 사람의 78.24%와 72.36%에 크게 못 미쳤고 실패의 상당수는 클릭 정확도 문제였다.
핵심 내용 읽기 →
AI 엔지니어링 워크숍 강연 요약. 언어모델의 구조와 한계부터 프롬프트·컨텍스트 캐싱·RAG·워크플로·에이전트로 올라가는 단계별 선택 기준, 메모리 관리와 평가 체계, 보안 가드레일까지 실무 관점으로 정리했다.
핵심 내용 읽기 →
서울대 DSBA 연구실 세미나가 과학 분야 에이전틱 AI 논문 두 편을 정리했다. 화학 도구 18종을 붙인 에이전트와, 모호한 자연어 요청을 물리 시뮬레이션으로 바꾸는 자기수정 멀티에이전트 구조를 다룬다.
핵심 내용 읽기 →
앨런AI연구소 네이선 램버트가 추론 모델 학습의 실제를 설명한다. 단위 테스트를 우회하는 보상 해킹, 아첨을 학습하는 과최적화, 평가·체감·가격의 균형, 스킬 다음에 필요한 캘리브레이션과 계획 능력을 짚는다.
핵심 내용 읽기 →
한국어로 지시하고 영어 자료를 읽어 일본어로 보고하는 업무는 흔하다. 67개 과제와 10개 언어로 구성된 다국어 장기 업무 벤치마크는 같은 모델도 하네스와 언어에 따라 20~30점씩 흔들린다는 결과를 내놨다.
핵심 내용 읽기 →
음성 에이전트를 실제 서비스로 굴리는 두 회사가 아키텍처 선택과 지연시간 예산, 평가 방법, 장애 대응까지 공개했다. 데모와 프로덕션의 간극을 메우는 실전 노하우를 정리했다.
핵심 내용 읽기 →
LLM에게 다른 LLM의 답변을 채점하게 하는 방식은 얼마나 믿을 만할까. 22개 유형의 오류를 일부러 심어 평가자 모델을 시험한 FBI 프레임워크 연구 결과를 정리했다.
핵심 내용 읽기 →
SonderMind가 공개한 정신건강 AI 코치 ‘Sonder’의 안전 설계. 입력·출력 가드레일을 별도 LLM 판정으로 분리하고, 임상의가 주석한 실제 대화를 평가로 바꿔 CI에 넣는 학습 루프로 안전성을 검증한다.
핵심 내용 읽기 →
Chroma 연구진의 '컨텍스트 로트' 논문은 입력이 길어질수록 LLM 성능이 일관되게 유지되지 않음을 보인다. 방해 문구·유사도·문맥 셔플 실험으로 '무엇을 컨텍스트에 넣는가'가 왜 중요한지 짚는다.
핵심 내용 읽기 →
우버이츠 컴퓨터비전팀이 공개한 이미지 향상 AI 에이전트의 평가 설계. 라우터·QA 게이트·드리프트 자동튜닝으로 사람 개입 없이 스스로 교정하는 폐루프를 실전 사례로 짚는다.
핵심 내용 읽기 →
구글 유튜브 광고팀 엔지니어들이 비결정적인 AI 에이전트를 신뢰할 수 있게 만드는 방법을 설명한다. 작은 직관 기반 평가에서 시작해 골든셋과 LLM 심판, 실행 궤적 분석으로 확장하는 실전 과정을 다룬다.
핵심 내용 읽기 →
아리즈 공동창업자가 매달 1억 건 평가 경험을 바탕으로, 고정된 LLM 심판을 넘어 에이전트로 에이전트를 평가하는 '에이전트 심판'이 왜 AI 평가의 다음 단계인지 자사 에이전트 사례를 들어 설명한다.
핵심 내용 읽기 →
앤던랩스가 자판기 시뮬레이션 벤딩벤치와 스톡홀름 카페·샌프란시스코 매장 실험으로 확인한 AI 에이전트의 장기 운영 능력, 그리고 아무도 지시하지 않았는데 저절로 나타난 담합과 거짓말, 시뮬레이션 자각 문제를 정리했다.
핵심 내용 읽기 →
AI 개발 컨퍼런스 발표에서 코딩 에이전트 개발자가 벤치마크 점수 맹신과 감(vibe) 의존을 모두 비판했다. 남의 평가를 해석하는 법, 평가로 에이전트를 개선하는 법, 직접 평가를 만드는 법까지 3단계로 정리했다.
핵심 내용 읽기 →
LLM이 LLM을 채점하는 관행, 정의 없이 뭉뚱그려진 안전성, 범용이라는 모호한 약속까지. 자연어처리와 평가 방법론을 연구해 온 학자가 짚은 AI 벤치마크의 구조적 허점과, 이를 고치기 위한 현실적인 개선 방향을 정리했다.
핵심 내용 읽기 →
랭체인 공동창업자 해리슨 체이스가 웨비나에서 AI 에이전트 개발 생애주기를 빌드·테스트·배포·모니터링·거버넌스로 나눠 설명했다. 에이전트를 실제 서비스에서 안정적으로 굴리는 데 필요한 작업들을 정리했다.
핵심 내용 읽기 →
환자 안전과 규제가 걸린 의료에서 AI 에이전트를 어떻게 빠르고도 안전하게 배포할까. Abridge가 LangGraph·LangSmith로 세운 평가 스택과 릴리스 전략을 정리했다.
핵심 내용 읽기 →
정답 개수만 세는 LLM 벤치마크의 한계를 심리측정학의 문항반응이론(IRT)으로 넘어서는 방법. 문항 난이도·변별력·모델 지능을 함께 추정해 평가를 정교하게 만든다.
핵심 내용 읽기 →
단일 정확도 대신 심리측정학의 문항반응이론(IRT)으로 LLM을 평가하는 방법. 문항 난이도·변별도와 모델 능력을 따로 추정해 벤치마크 감사, 데이터 유출 탐지, 모델 증류 여부까지 밝혀낸다.
핵심 내용 읽기 →
스탠퍼드 CME295 강의를 바탕으로 LLM 평가법을 정리한다. 사람 평가와 규칙 기반 지표의 한계, LLM-as-a-Judge와 편향, MMLU·SWE-bench 등 벤치마크와 데이터 오염 문제를 다룬다.
핵심 내용 읽기 →
여러 프롬프트 중 최고를 고를 때 모두 균등 평가하면 예산이 낭비된다. 멀티암드 밴딧의 최적 암 식별 알고리즘(연속 제거·순차 반감)으로 나쁜 후보를 빨리 걸러 더 적은 비용으로 최적 프롬프트를 찾는 방법.
핵심 내용 읽기 →
객관식 벤치마크로는 잴 수 없는 주관적 글쓰기 품질을, 참조 기반 지표와 인간 평가, 그리고 LLM을 심사위원으로 쓰는 세 가지 방식으로 어떻게 측정하는지 정리했습니다. 각 방법의 장단점과 편향 문제까지 살펴봅니다.
핵심 내용 읽기 →
MongoDB의 데이터 과학자가 건강보험 청구 심사 사례로 보여주는 AI 시스템 설계법. 바이브 코딩의 한계, 제품 요구사항·시스템 설계·평가·최적화 4단계를 정리한다.
핵심 내용 읽기 →
에이전트형 AI를 production에서 안정적으로 운영하려면 평가 체계가 필수다. 단위 테스트, 휴먼 검토, LLM-as-a-Judge로 이어지는 3단계 평가 전략을 정리했다.
핵심 내용 읽기 →
대규모 언어모델의 품질을 자동 지표와 사람 평가로 나눠 측정하는 방법을 정리했다. BLEU·ROUGE·BERTScore의 차이와 작업별 선택 기준, 생성·자동평가·사람검토·개선으로 이어지는 파이프라인을 쉽게 풀어 설명한다.
핵심 내용 읽기 →
수많은 AI 출력물을 사람이 일일이 채점하긴 어렵다. LLM이 다른 LLM의 출력을 평가하는 LLM-as-a-Judge의 두 전략, 장점, 그리고 위치·장황함·자기선호 편향을 정리했다.
핵심 내용 읽기 →
데모에서 멈추지 않고 AI 에이전트를 실제 운영에 안착시키기 위한 평가·관측·데이터 기반·오케스트레이션·거버넌스 다섯 기둥과 은행 챗봇 사례를 정리했습니다.
핵심 내용 읽기 →