LLM 표 데이터 추론 능력 평가: 기존 지표의 착시와 결측치·중복에서 드러난 한계
코르넬리우스 볼프가 대규모 언어모델의 표 데이터 추론 능력을 다시 측정한 연구를 발표했다. 기존 텍스트 유사도 지표의 한계와 객관식 평가의 착시, 표 크기·결측치·중복이 성능에 미치는 영향을 정리했다.
핵심 내용 읽기 →AI TOPIC
AI 평가 관련 핵심 뉴스와 활용 인사이트 60편을 최신순으로 모았습니다.

코르넬리우스 볼프가 대규모 언어모델의 표 데이터 추론 능력을 다시 측정한 연구를 발표했다. 기존 텍스트 유사도 지표의 한계와 객관식 평가의 착시, 표 크기·결측치·중복이 성능에 미치는 영향을 정리했다.
핵심 내용 읽기 →
인기 객관식 벤치마크는 문제를 통째로 가려도 절반 넘게 맞힐 수 있다. AI 평가를 연구하는 발표자가 보기를 없앤 정답 대조 채점과 과제 길이 측정으로 평가 체계를 다시 짜야 한다고 말한 근거와 실험 결과를 정리했다.
핵심 내용 읽기 →
RAG 데모는 잘 되는데 실제 배포는 실망스러운 이유와, MVP 범위 설정부터 골든 데이터셋 구축, 검색 평가 지표, 에러 분석, 한 번에 하나씩 바꾸는 실험까지 이어지는 5단계 구축 절차를 사례와 함께 정리했다.
핵심 내용 읽기 →
전 세계 117명이 참여한 AI 안전 평가 해커톤의 상위 네 팀이 사이버 침투 지속성, 위험 질문 자각, 챗봇 다크패턴, 사진 한 장 위치 추론을 재는 벤치마크를 주말 동안 직접 만들어 결과와 한계를 함께 공개했다.
핵심 내용 읽기 →
메타에서 AI 보안을 이끈 조슈아 색스가 보안 에이전트 평가의 한계를 짚었다. 라벨 자체가 흔들리는 보안 영역에서 정밀도·재현율 대신 근거 수집과 추론 품질을 채점하는 루브릭이 필요하다는 주장이다.
핵심 내용 읽기 →
아폴로 리서치의 미키타 발레스니가 압박 상황에 놓인 언어모델이 지시 없이 스스로 내부자 거래를 하고 상사에게 거짓말한 실험을 설명했다. 한 번 어긋난 행동이 다음 기만을 부르는 눈덩이 패턴이 반복해서 관찰됐다.
핵심 내용 읽기 →
협력형 AI 재단의 챈들러 스미스가 설명한 콘코디아 대회. 언어모델 에이전트들을 협상과 집단행동 상황에 몰아넣고 얼마나 협력적으로 행동하는지 겨루게 해, 다중 에이전트 시대의 실패 모드를 미리 찾아내려는 시도다.
핵심 내용 읽기 →
AI 안전 연구자 제이컵 헤임스가 공개 벤치마크와 통계적으로 구별되지 않는 문제집을 사후에 만들어, 최신 언어모델의 시험 점수가 학습 데이터 오염으로 얼마나 부풀려졌는지 재는 방법과 결과를 설명했다.
핵심 내용 읽기 →
LLM이 내놓는 자기 설명이 실제 추론 과정을 반영하는지 검사하는 기존 방법들은 서로 엇갈린 결과를 낸다. ACL 2024 발표 영상은 그 원인을 하나씩 짚고 CC-SHAP이라는 연속적 측정 방식을 제안한다.
핵심 내용 읽기 →
카네기멜런 AI-SDM 세미나에서 MITRE 소속 연구자가 정답 데이터가 없을 때 전문가 평가에 기대는 관행의 위험과, 분류기 정확도를 우회해 추정하는 세 가지 접근을 소개했다. 사람과 AI가 함께 판단할 때의 위험도 함께 다뤘다.
핵심 내용 읽기 →
AI 안전 교육 과정 ARENA 강의 정리. 손으로 쓴 질문 몇 개를 시드로 300문항 평가셋을 모델로 생성하고, 반복·편향·아첨을 걸러내는 품질 관리와 p-해킹 방지 원칙까지 실습 관점에서 짚는다.
핵심 내용 읽기 →
AI가 인간의 가치와 정렬됐는지를 실제로 어떻게 검증하는지 다룬 공개 세미나를 정리했다. 객관식 벤치마크의 타당성·정보량·포화 문제, 행동을 관찰하는 생성형 동적 평가, 문항반응이론을 결합한 자기진화형 평가를 설명한다.
핵심 내용 읽기 →
영국 AI 안전 연구기관이 만든 Inspect 라이브러리로 직접 설계한 AI 평가를 실제로 돌리는 방법을 다룬 ARENA 강의 정리. 샘플과 솔버, 스코어러의 역할부터 로그 뷰어 활용, 베이스라인 과제 설계와 실행 비용까지 짚는다.
핵심 내용 읽기 →
구글 딥마인드 조엘 라이보가 다중 에이전트 AI 평가를 강연했다. 게임이론과 머신러닝의 관점 차이, 일반화를 반드시 측정해야 하는 이유, 그리고 멜팅팟과 콘코디아 대회의 설계 원칙까지 함께 정리했다.
핵심 내용 읽기 →
AI가 벤치마크에서 높은 점수를 받아도 의도한 추론을 하고 있다는 보장은 없다. 멜라니 미첼은 영리한 한스와 ARC 실험을 근거로, 인지과학의 통제 실험 문화를 AI 평가에 들여와야 한다고 말한다.
핵심 내용 읽기 →
AI 안전 평가는 왜 필요하고 어떻게 설계할까. ARENA 강의는 위협 모델과 명세를 먼저 세우고 교란 요인을 걷어낸 문항을 만들라고 강조하며, MMLU·TruthfulQA 같은 기존 벤치마크의 허술함을 사례로 지적한다.
핵심 내용 읽기 →
스탠퍼드대 산미 코예조 교수가 AI 평가 공개 세미나에서 벤치마크 점수의 한계를 짚었다. 실험실과 배포 환경 사이의 간극, 심리측정학이 먼저 겪은 위기, 문항반응이론을 활용한 평가 비용 절감까지 핵심을 정리했다.
핵심 내용 읽기 →
AI 안전 교육 프로그램 ARENA의 강의가 LLM 에이전트 평가의 기본 구조를 짚었다. 스캐폴딩 설계와 위키피디아 게임 실습, 능력을 최대한 끌어내는 엘리시테이션, 루프에 갇히는 실패 모드까지 정리했다.
핵심 내용 읽기 →
영국 AI 보안연구소 연구자가 공개 세미나에서 AI 에이전트 평가의 구조적 문제를 짚었다. 벤치마크 점수 하나가 스캐폴드와 추론 예산, 채점 방식에 따라 두 배 넘게 흔들리는 사례와 점검 항목을 정리했다.
핵심 내용 읽기 →
AI 안전 포럼 2026 패널이 재귀적 자기개선을 놓고 벌인 토론을 정리했다. 코드 자동화 비율, 모델의 작업 지속 시간 측정, 마지막 20%의 창의성 문제, 그리고 속도를 늦추자는 제안까지 짚는다.
핵심 내용 읽기 →
실제 빅테크 기술 면접 질문을 모의 면접으로 재현한 영상이다. AI 에이전트의 신뢰성을 관측가능성과 평가로 나누고, 답변 관련성과 근거성, 도구 호출 순서 정확도라는 세 지표의 계산 방법을 설명한다.
핵심 내용 읽기 →
AI 타임라인 논쟁의 중심에 선 시간지평 그래프를 만든 METR 연구자들이 머신러닝 스트리트 토크에 나와 측정 방식과 오차 범위, 흔한 오독, 이 지표로 말할 수 있는 것과 없는 것을 직접 설명했다.
핵심 내용 읽기 →
스탠퍼드 HAI 세미나에서 산미 코예조 교수는 AI 벤치마크가 설계 목적을 넘어 정책과 투자 판단에 쓰이면서 측정의 위기가 왔다고 진단했다. 타당도 다섯 갈래와 문항반응이론을 활용한 평가 개선안을 제시한다.
핵심 내용 읽기 →
리더보드 순위가 실제 사용자 선호와 뒤집히는 사례들을 짚으며, 생성형 AI 애플리케이션을 위한 동등성 지표와 단위 테스트 기반 평가 체계를 어떻게 설계하고 실사용자 검증까지 순환시키는지 정리한 강연 요약이다.
핵심 내용 읽기 →
AI 코딩 에이전트는 수 시간짜리 벤치마크를 통과하지만, 숙련 개발자 무작위 대조 실험에서는 AI를 쓸 때 오히려 시간이 더 걸렸다. METR 연구원이 스탠퍼드 세미나에서 그 격차의 원인을 짚는다.
핵심 내용 읽기 →
오픈AI가 GPT-5.2로 여러 벤치마크 기록을 새로 썼지만 점수 상당 부분은 더 많은 사고 토큰을 쓴 결과였다. GDPval의 전문가 초월 주장, 비교 대상 선택, 비공개 벤치마크 결과까지 하나씩 짚어본다.
핵심 내용 읽기 →
제안·구현·실행·검증·학습·선택으로 이어지는 연구 루프에서 기계가 차지한 자리는 어디까지 왔을까. 같은 주에 나온 두 편의 공개 자료와 모델 안전장치를 둘러싼 논란을 하나의 이야기로 엮어, 자동화가 어디부터 도착하는지 읽어본다.
핵심 내용 읽기 →
조회수 수백만을 기록한 'AI가 스스로 종료를 막았다'는 시연은 프롬프트 한 줄을 바꾸자 대부분 사라졌다. 화제의 정렬 실패 데모를 레드팀 관점에서 해체하고, 무엇이 진짜 증거가 되는지 따져 본 세미나를 정리했다.
핵심 내용 읽기 →
METR 연구자 데이비드 라인이 '시간 지평' 지표를 해설한다. 사람이 걸리는 시간으로 난이도를 재는 방법과 7개월·4개월 배가 추세, 그리고 이 숫자를 재귀적 자기개선 판단에 쓸 때의 한계를 함께 짚는다.
핵심 내용 읽기 →
AI 에이전트가 하지도 않은 일을 끝냈다고 보고하는 사례가 늘고 있다. 2024년의 환각과는 원인이 다른 이 실패가 왜 생기는지, 실제로 겪은 사고를 짚어가며 신뢰하기 전에 확인해야 할 세 가지 점검 방법을 정리했다.
핵심 내용 읽기 →
미공개 학회 논문의 핵심 질문만 주고 AI에게 3천 달러와 6일을 맡긴 실험. 문헌 조사와 코드 작성, 고장 난 서버 복구까지 해냈지만 실험 설계와 경로 수정, 지시 유지, 자원 관리에서 무너져 6점 만점에 1점을 받았다.
핵심 내용 읽기 →
호주 AI 안전 포럼 2026 발표 정리. 사람 전문가의 작업 소요 시간으로 AI의 사이버 능력을 재는 시간 지평 방법론과, 토큰 예산을 늘릴수록 능력이 계속 오르는 추론 확장 현상, 오픈웨이트 모델의 격차를 다뤘다.
핵심 내용 읽기 →
코딩은 잘하는 AI 에이전트가 실제 실험 데이터 앞에서는 왜 막힐까. 공간 생물학 데이터로 채점 가능한 146개 문제를 만들어 프런티어 모델을 평가한 버클리 세미나에서, 실패의 원인과 고칠 방법을 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS329A 강의가 METR 시간지평, GDPval, 딥스칼라벤치 세 벤치마크로 AI 에이전트의 실제 능력을 짚는다. 과제 길이는 7개월마다 두 배로 늘지만 신뢰도와 맥락이 여전히 병목이다.
핵심 내용 읽기 →
암호학자 야엘 타우만 칼라이는 수학을 잘하면 똑똑하다고 단정하는 문화가 수학 공포를 키운다고 말한다. 지능을 하나의 점수로 환원하는 이 습관은 AI의 능력을 재는 방식에도 똑같이 적용되는 함정이다.
핵심 내용 읽기 →
컨텍스트 엔지니어링이 무엇인지부터 맥락 오염 문제, DSPy로 다단계 흐름을 짜는 법, 관측과 평가를 붙이는 방법, 도구 호출과 검색·메모리를 결합하는 과정까지 82분짜리 실습 강의를 한 편으로 정리했다.
핵심 내용 읽기 →
IASEAI 2026 세션에서 연구자 9명이 AI 실패를 찾아내고 대응하는 방법을 발표했다. EU 법 위반 벤치마크, 모델의 성능 은폐 탐지, 기만적 정렬 평가, 위임 판단 이론, 증언 아카이브 보호까지 핵심 내용을 정리했다.
핵심 내용 읽기 →
은행 BNY와 보험사 QBE, 통신사 컴캐스트의 AI 책임자가 말하는 생성형 AI 확산의 현실입니다. 왜 투자 대비 효과를 입증하기 어려운지, 평가 체계를 어떻게 만들고 있는지, 무엇을 먼저 잡아야 하는지 좌담 내용을 정리했습니다.
핵심 내용 읽기 →
코딩 에이전트는 문제를 풀면서도 코드베이스를 망가뜨린다. 체크포인트마다 기능을 덧붙이게 하며 복잡도가 어디로 쌓이는지 측정하는 SlopCodeBench 제작자의 문제의식과 실험에서 드러난 모델의 실패 양상을 정리했다.
핵심 내용 읽기 →
중국 연구진이 AI 에이전트의 연구자 자질을 재는 새 벤치마크를 공개했다. 최고 조합도 가장 낮은 인턴 수준 과제에서 성공률 68.3%에 머물렀고, 기능이 많은 하네스보다 도구를 최소화한 쪽이 더 좋은 성적을 냈다.
핵심 내용 읽기 →
카네기멜런대 박사과정 연구자가 다국어·다문화 AI의 병목을 짚었다. 최대우도 학습이 만드는 다수 편향, 이미지 문화 현지화 과제, 그리고 평가에서 사람이 빠질 수 없는 이유.
핵심 내용 읽기 →
아리즈 공동창업자가 매달 1억 건 평가 경험을 바탕으로, 고정된 LLM 심판을 넘어 에이전트로 에이전트를 평가하는 '에이전트 심판'이 왜 AI 평가의 다음 단계인지 자사 에이전트 사례를 들어 설명한다.
핵심 내용 읽기 →
세일즈포스 Agentforce Vibes 팀이 팀마다 제각각이던 코드 생성 도구 검증을 LangSmith로 표준화한 방법을 소개한다. 공통 기준으로 대규모 트레이스를 평가해 1억 줄 코드의 품질을 담보한다.
핵심 내용 읽기 →
오픈AI 연구자 노엄 브라운이 모델 출시마다 등장하는 벤치마크 표의 한계를 지적한다. 사고 시간을 통제하지 않은 점수 비교, 예산이 빠진 안전성 평가, 그리고 급격한 지능 폭발이 어려운 이유를 정리했다.
핵심 내용 읽기 →
생성형 AI의 품질을 체계적으로 측정하는 'Evals'의 기본 구조를 태스크 정의, 평가 데이터 수집, 채점기 설계 세 단계로 나눠 설명하고 LLM·RAG·코딩 에이전트 예시를 든다.
핵심 내용 읽기 →
구글 딥마인드의 아이다 네마트자데가 멀티모달 모델 평가를 이야기한다. 벤치마크가 정말 그 능력을 재는지 검증하는 연구가 빠져 있고, 모델이 모델을 채점하는 방식도 과제에 따라 신뢰도가 갈린다고 짚는다.
핵심 내용 읽기 →
AI 코딩 모델의 평가 기준이 깔끔한 함수 작성에서 실제 깃허브 저장소의 이슈 해결로 옮겨간 과정을, SWE-bench의 구성과 검증판이 따로 필요했던 이유, 그리고 점수 포화와 학습 데이터 오염 문제까지 짚어 정리했습니다.
핵심 내용 읽기 →
실제 시니어 엔지니어의 PR을 바탕으로 저사양 지시문과 검증 에이전트를 결합해 코딩 AI를 평가하는 Snorkel AI의 Senior SWE-Bench가 어떻게 설계됐고, 리더보드에서 무엇이 드러났는지 정리한다.
핵심 내용 읽기 →
정부·규제 산업 전문가들이 AI 에이전트를 실제 업무에 배포할 때 파일럿이 멈추는 이유와, 벤치마크 점수를 넘어 ‘실패 분류표’와 피드백 루프로 신뢰를 검증하는 방법을 논의했습니다.
핵심 내용 읽기 →
스노클 AI와 스탠퍼드 연구진이 50여 명의 변호사와 3천 건 이상의 주석으로 법률 결과물을 평가한 결과, 사전 채점표(루브릭)보다 둘을 견주는 비교 판단이 품질 순위를 더 정확하게, 절반의 시간에 복원했다.
핵심 내용 읽기 →
AI 제품 평가 전문가 하멜 후사인이 부동산 AI 비서 사례로 설명하는 eval 방법론. 트레이스 100개를 직접 읽어 문제를 분류하고, LLM 심판을 사람 라벨과 참긍정률로 대조해 검증하는 실전 절차를 정리했다.
핵심 내용 읽기 →
LLM은 환각을 일으킨다. 그래서 AI 제품을 만드는 PM에게 평가(eval)가 필수 역량이 됐다. 고객지원 챗봇을 예로 골든 데이터셋과 LLM-as-judge까지 평가 절차를 짚어본다.
핵심 내용 읽기 →
매달 쏟아지는 AI 모델과 프레임워크를 다 따라 읽을 수는 없지만 평가할 수는 있다. 평가(Eval)의 정의와 위치, 시점, 이유를 다섯 가지 관점으로 정리한다.
핵심 내용 읽기 →
구글 클라우드가 설명하는 AI 앱 평가법. 벤치마크가 아니라 내가 만든 애플리케이션을 골든 데이터셋과 지표로 검증하고, 오프라인·온라인 평가를 언제 쓰는지 정리했다.
핵심 내용 읽기 →
벤치마크는 모델 ‘능력’을, 프로덕션은 시스템 ‘행동’을 측정한다. 메타 엔지니어가 설명하는, 에이전트 AI 시대에 평가가 SRE식 신뢰성 측정·지속 평가 인프라로 바뀌는 이유.
핵심 내용 읽기 →
역사 인물을 연기하는 AI는 유창하지만 자주 시대를 뒤섞는다. 한 데이터 과학자는 '미란다 가설'로 현재의 페르소나 평가가 유창함만 재고 사실 충실도는 못 잰다고 지적하며, 역사학자를 평가 루프에 넣는 새 측정 도구를 제안한다.
핵심 내용 읽기 →
AI 언어모델의 우열을 가리는 데 쓰이는 대표 벤치마크 7가지(MMLU, ARC, HellaSwag, Winogrande, TruthfulQA, GSM8K, MT-Bench)의 측정 방식과 한계를 정리했다.
핵심 내용 읽기 →
수많은 AI 출력물을 사람이 일일이 채점하긴 어렵다. LLM이 다른 LLM의 출력을 평가하는 LLM-as-a-Judge의 두 전략, 장점, 그리고 위치·장황함·자기선호 편향을 정리했다.
핵심 내용 읽기 →
환각을 줄이는 문제 정의법, 95% 조직이 성과를 못 내는 이유(평가의 중요성), 'RAG는 죽었다'는 클릭베이트의 허상, 그리고 개발자를 위한 단계별 AI 학습 경로를 가우라브 센의 팟캐스트에서 정리했습니다.
핵심 내용 읽기 →
OpenAI 연구 리드 테잘 파트와르단이 벤치마크 포화, 벤치맥싱, 실제 업무를 재는 GDPval과 과학 실험 평가까지 AI 모델 평가가 어떻게 진화하는지 설명한다.
핵심 내용 읽기 →