LLM 표 데이터 추론 능력 평가: 기존 지표의 착시와 결측치·중복에서 드러난 한계
코르넬리우스 볼프가 대규모 언어모델의 표 데이터 추론 능력을 다시 측정한 연구를 발표했다. 기존 텍스트 유사도 지표의 한계와 객관식 평가의 착시, 표 크기·결측치·중복이 성능에 미치는 영향을 정리했다.
핵심 내용 읽기 →AI TOPIC
벤치마크 관련 핵심 뉴스와 활용 인사이트 80편을 최신순으로 모았습니다.

코르넬리우스 볼프가 대규모 언어모델의 표 데이터 추론 능력을 다시 측정한 연구를 발표했다. 기존 텍스트 유사도 지표의 한계와 객관식 평가의 착시, 표 크기·결측치·중복이 성능에 미치는 영향을 정리했다.
핵심 내용 읽기 →
AI 평가의 관심사는 무엇을 아는가에서 무엇을 할 수 있는가로 옮겨갔다. 과제마다 전용 도커 환경을 주고 에이전트를 시험하는 터미널 벤치의 설계와, 최고 모델도 50%를 넘지 못하는 이유를 정리했다.
핵심 내용 읽기 →
인기 객관식 벤치마크는 문제를 통째로 가려도 절반 넘게 맞힐 수 있다. AI 평가를 연구하는 발표자가 보기를 없앤 정답 대조 채점과 과제 길이 측정으로 평가 체계를 다시 짜야 한다고 말한 근거와 실험 결과를 정리했다.
핵심 내용 읽기 →
GPT-4가 디버거를 스스로 다뤄 보안 문제를 풀어내는 장면에서 출발한 프로젝트다. CTF 문제를 도커 컨테이너로 재현해 LLM의 사이버 공격 능력을 측정하는 벤치마크의 설계와, 그 과정에서 드러난 함정들을 정리했다.
핵심 내용 읽기 →
로스쿨 시험 340개에서 뽑은 문항으로 대형 언어 모델 26개를 평가한 LEXam 연구 발표를 정리했다. 오답 보기를 늘리기만 해도 정확도가 절반으로 떨어졌고, 추론 시간을 늘려도 성능은 나아지지 않았다.
핵심 내용 읽기 →
앨런AI연구소 연구진이 GRE·SAT 같은 시험이 쓰는 문항반응이론을 LLM 벤치마크에 적용했다. 모델 실력에 맞춰 문항을 골라 가는 유동적 벤치마킹은 50문항만으로 무작위 500문항보다 나은 평가 품질을 냈다고 한다.
핵심 내용 읽기 →
전 세계 117명이 참여한 AI 안전 평가 해커톤의 상위 네 팀이 사이버 침투 지속성, 위험 질문 자각, 챗봇 다크패턴, 사진 한 장 위치 추론을 재는 벤치마크를 주말 동안 직접 만들어 결과와 한계를 함께 공개했다.
핵심 내용 읽기 →
기계공학 출신 연구자가 AI 안전 분야로 옮겨 해커톤 참여에서 논문 투고까지 나아간 과정을 정리했다. 벤치마크 데이터 오염의 실제 영향을 측정한 연구와, 기회가 부족한 분야에서 스스로 기회를 만드는 방법을 다룬다.
핵심 내용 읽기 →
AI 안전 연구자 제이컵 헤임스가 공개 벤치마크와 통계적으로 구별되지 않는 문제집을 사후에 만들어, 최신 언어모델의 시험 점수가 학습 데이터 오염으로 얼마나 부풀려졌는지 재는 방법과 결과를 설명했다.
핵심 내용 읽기 →
아파트리서치가 만든 다크벤치는 브랜드 편향, 의인화, 스니킹, 아첨 등 대화형 AI가 사용자 자율성을 줄이는 여섯 가지 다크 패턴을 정의하고 모델별 성향을 비교 측정한 적대적 벤치마크입니다. 파리 AI 액션 서밋 발표 내용을 정리했습니다.
핵심 내용 읽기 →
시각 언어 모델 에이전트가 진단 도구를 직접 만들어 데이터에 맞는 통계 모델을 찾아가는 VESTA 연구 소개. 천문 과제를 포함한 DAWN 벤치마크 결과와 도구 사용 방식에 따른 성능 차이를 함께 정리했다.
핵심 내용 읽기 →
AI 세이프티 폴란드 세미나에서 공개된 비밀 지식 추출 벤치마크를 정리했다. 일부러 비밀을 심은 모델 세 종을 만들어 프리필 공격과 해석가능성 기법이 얼마나 비밀을 캐내는지 겨루게 한 실험과 그 한계를 다룬다.
핵심 내용 읽기 →
20만 건이 넘는 공격 시도를 모은 간접 프롬프트 인젝션 공개 대회 결과를 정리했다. 도구 사용과 코딩, 컴퓨터 사용 환경별 공격 성공률과 에이전트의 은폐 행동, 견고한 모델을 뚫은 공격이 다른 모델로 전이되는 현상, 가드레일 분류기의 한계까지 짚는다.
핵심 내용 읽기 →
AI 안전 평가는 왜 필요하고 어떻게 설계할까. ARENA 강의는 위협 모델과 명세를 먼저 세우고 교란 요인을 걷어낸 문항을 만들라고 강조하며, MMLU·TruthfulQA 같은 기존 벤치마크의 허술함을 사례로 지적한다.
핵심 내용 읽기 →
스탠퍼드대 산미 코예조 교수가 AI 평가 공개 세미나에서 벤치마크 점수의 한계를 짚었다. 실험실과 배포 환경 사이의 간극, 심리측정학이 먼저 겪은 위기, 문항반응이론을 활용한 평가 비용 절감까지 핵심을 정리했다.
핵심 내용 읽기 →
영국 AI 보안연구소 연구자가 공개 세미나에서 AI 에이전트 평가의 구조적 문제를 짚었다. 벤치마크 점수 하나가 스캐폴드와 추론 예산, 채점 방식에 따라 두 배 넘게 흔들리는 사례와 점검 항목을 정리했다.
핵심 내용 읽기 →
스탠퍼드 HELM 연구자가 3년 넘게 대규모 모델 평가를 운영하며 확인한 문제를 정리한다. 벤치마크 포화, 공개되지 않는 원본 평가 로그, 프롬프트 문구와 입력 형식만 바꿔도 모델 순위가 뒤집히는 재현성 문제를 다룬다.
핵심 내용 읽기 →
CMU 고급 자연어처리 강의가 언어모델 평가의 역사와 지표, MMLU의 포화, 사람이 직접 투표하는 챗봇 아레나와 LLM 심판의 장단점, 그리고 ViT·CLIP·LLaVA로 이어지는 멀티모달 기초를 한 번에 짚는다.
핵심 내용 읽기 →
AI 엔지니어 컨퍼런스 발표에서 연구자가 화면을 보지 않고 녹화된 동작만 되풀이하는 1MB 스크립트로 최신 모델을 앞섰다. 컴퓨터 사용 에이전트 벤치마크의 결정론성과 과신된 신뢰구간이 만드는 구조적 문제, 그리고 그 해법을 짚는다.
핵심 내용 읽기 →
대학 LLM 강의의 평가 회차를 정리했다. 퍼플렉시티와 MMLU·GPQA 같은 시험형 벤치마크, 챗봇 아레나의 사람 선호 평가, SWE-bench 등 에이전트 벤치마크의 원리를 짚고 포화·데이터 오염·리더보드 착시 문제까지 살펴본다.
핵심 내용 읽기 →
AI 타임라인 논쟁의 중심에 선 시간지평 그래프를 만든 METR 연구자들이 머신러닝 스트리트 토크에 나와 측정 방식과 오차 범위, 흔한 오독, 이 지표로 말할 수 있는 것과 없는 것을 직접 설명했다.
핵심 내용 읽기 →
서울대 DSBA 연구실이 타우 벤치와 후속 연구를 리뷰하며 멀티턴 상호작용과 정책 준수, 반복 일관성을 함께 재야 하는 이유를 정리하고, 사용자와 협업할 때 오히려 점수가 떨어지는 평가 결과를 짚었다.
핵심 내용 읽기 →
뉴욕대 디지털이론연구소가 연 컬처럴 AI 컨퍼런스 첫 패널에서 정치학자와 머신러닝 연구자, 인류학자, 미디어 이론가가 언어모델을 초지능 서사 대신 사회·문화의 기술로 읽는 네 가지 접근을 나란히 내놓았다.
핵심 내용 읽기 →
웹 에이전트 평가는 보통 과제 성공 여부만 본다. 카네기멜런대 연구자는 계획 능력을 시간 순서 판단·미래 상태 예측·행동 선택으로 쪼갠 뒤 기존 데이터셋을 재활용해 값싸게 채점하는 방법을 제시했다.
핵심 내용 읽기 →
AI 에이전트에 붙이는 스킬이 늘 도움이 되지는 않는다. 약 80개 스킬을 검증한 벤치마크와 성격이 다른 세 가지 과제 실험을 근거로, 스킬이 역효과를 내는 조건과 실무에서 쓸 수 있는 평가 방법을 정리했다.
핵심 내용 읽기 →
애플 연구진은 GSM8K 문제를 템플릿으로 바꿔 변형 문제를 대량 생성하는 GSM-Symbolic을 만들었다. 이름만 바꾸면 성적이 유지되지만 숫자를 바꾸거나 무관한 문장을 넣으면 정확도가 크게 떨어진다는 결과와, 그 해석을 둘러싼 반론을 함께 정리했다.
핵심 내용 읽기 →
오픈AI가 GPT-5.2로 여러 벤치마크 기록을 새로 썼지만 점수 상당 부분은 더 많은 사고 토큰을 쓴 결과였다. GDPval의 전문가 초월 주장, 비교 대상 선택, 비공개 벤치마크 결과까지 하나씩 짚어본다.
핵심 내용 읽기 →
세미애널리시스 팀이 만든 오픈소스 추론 벤치마크 InferenceX 발표를 정리했다. 최대 처리량 대신 파레토 곡선을 보는 이유, 블랙웰과 FP4가 만든 비용 하락, AMD의 소프트웨어 격차, 그리고 MoE 시대의 서빙 기법을 다룬다.
핵심 내용 읽기 →
AI 안전 포럼 2026 발표 정리. 진술의 강도를 일곱 단계로 바꾼 '사다리'를 만들어 16개 모델의 선호를 시험했다. 짝 비교 정답률은 약 97%였지만 단조성은 무너졌고, 종교와 개인의 자유 범주에서 비정합성이 특히 두드러졌다.
핵심 내용 읽기 →
RFdiffusion을 비롯한 단백질 구조 생성 모델을 벤치마크하자, 실험으로 확인된 자연 단백질의 40~60%가 설계 가능성 검사에서 탈락했다. 평가 지표가 만들어낸 구조 공간의 공백과 그 대가를 스탠퍼드 연구진이 짚는다.
핵심 내용 읽기 →
실험 데이터가 없는 판데믹 초기에 AI로 바이러스 변이를 예측할 수 있을까. 버클리 세미나 발표는 진화 서열 모델이 실험을 앞선 사례와 함께, 단백질 언어모델이 유독 바이러스에만 약한 데이터 차원의 이유를 짚는다.
핵심 내용 읽기 →
코딩은 잘하는 AI 에이전트가 실제 실험 데이터 앞에서는 왜 막힐까. 공간 생물학 데이터로 채점 가능한 146개 문제를 만들어 프런티어 모델을 평가한 버클리 세미나에서, 실패의 원인과 고칠 방법을 정리했다.
핵심 내용 읽기 →
모델 카드에 적힌 벤치마크 점수는 왜 서로 비교하기 어려울까. 엔비디아 평가 팀 매니저가 파이토치 콘퍼런스 유럽에서 공개한 LLM 평가의 함정, 나쁜 관행, 재현 가능한 측정 방법과 에이전트 평가의 과제를 정리했다.
핵심 내용 읽기 →
스탠퍼드 연구팀이 만든 터미널벤치는 실무자가 직접 겪은 문제 80개를 각각 독립된 도커 환경에 담은 고난도 에이전트 벤치마크다. 공개 당시 최고 성적 50%, 반복되는 실패 유형과 스캐폴드가 점수에 미치는 영향을 정리했다.
핵심 내용 읽기 →
결함 라벨 없이 정상 과일 이미지만 학습해 표면 결함을 찾는 연구다. 사과·레몬·오렌지·토마토를 하나의 검출기로 다루는 새 벤치마크를 만들고, 학습이 필요 없는 기준선과 자체 설계 모델을 비교한 결과를 정리했다.
핵심 내용 읽기 →
앤트로픽이 공개한 클로드 페이블 5를 둘러싼 반응을 정리했다. 5천만 줄 코드 이전 성과와 한 번에 끝낸 데모들, 오푸스의 두 배인 가격과 토큰 소모, 무해한 질문까지 막는 안전장치 문제를 함께 짚는다.
핵심 내용 읽기 →
모델을 키울수록 투자 대비 성능 향상이 줄고 있다. 비용 최적화와 기업 전용 모델로 옮겨가는 시장의 흐름, 대형 언어 모델이 AGI에 이르지 못하는 세 가지 이유, 벤치마크 불신까지 짚은 분석을 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS329A 강의가 METR 시간지평, GDPval, 딥스칼라벤치 세 벤치마크로 AI 에이전트의 실제 능력을 짚는다. 과제 길이는 7개월마다 두 배로 늘지만 신뢰도와 맥락이 여전히 병목이다.
핵심 내용 읽기 →
마이크로소프트 리서치 인도 학술 세션의 다섯 개 발표를 정리했다. 다국어 데이터 격차와 이미지 생성의 지역 편향, 인도 법률 AI, 토크나이저 과분할 문제까지 AI 불평등이 만들어지는 통로를 차례로 짚는다.
핵심 내용 읽기 →
암호학자 야엘 타우만 칼라이는 수학을 잘하면 똑똑하다고 단정하는 문화가 수학 공포를 키운다고 말한다. 지능을 하나의 점수로 환원하는 이 습관은 AI의 능력을 재는 방식에도 똑같이 적용되는 함정이다.
핵심 내용 읽기 →
서울대 DSBA 연구실 세미나가 화학·물리 분야에서 움직이는 AI 에이전트를 다룬 논문 세 편을 정리했다. 최종 답이 아니라 도구 선택과 추론 과정을 분해해 평가해야 하는 이유, 그리고 언어 모델을 심판으로 쓸 때의 한계를 짚는다.
핵심 내용 읽기 →
실험 한 번에 수 테라바이트가 쏟아지는 생물학에서, 데이터 분석을 코드처럼 채점 가능한 과제로 바꿔 AI 과학 에이전트를 훈련하고 평가하는 방법을 라치바이오 CTO가 설명했다. 공간 생물학 벤치마크와 사람 검증, 장기 과제 설계까지 다룬다.
핵심 내용 읽기 →
테타 소프트웨어 창업자들이 AI 엔지니어 행사에서 '장기 과제'의 정의부터 다시 짚고, 에이전트를 훈련·평가하는 환경과 판정 모델을 어떻게 설계해야 하는지, 기존 금융 벤치마크는 왜 부족한지를 정리했다.
핵심 내용 읽기 →
카네기멜런대 데이비드 브럼리 교수가 보안 과제를 강화학습 환경으로 옮기는 설계 원칙을 정리하고, 크롬 V8 취약점 41건에 프런티어 모델을 붙여 크래시가 아니라 샌드박스 탈출까지 되는지 시험한 결과를 공개했다.
핵심 내용 읽기 →
오픈마인드의 코엔 판 데르 페인이 벤치마크 유출로 모델 성능을 믿기 어려워진 상황을 짚으며, 모델도 평가 데이터도 공개하지 않은 채 채점하는 PySyft v2의 구조와 AI 감사의 세 기둥을 설명했다.
핵심 내용 읽기 →
개발 중 20~30%였던 터미널벤치2 점수는 최근 제출에서 75%까지 올랐다. 제작자 알렉스 쇼가 벤치마크를 표준으로 만드는 조건과 과제 품질을 지키는 방법, 그리고 다음 병목인 검증자 자동화를 이야기했다.
핵심 내용 읽기 →
화면을 클릭하는 대신 터미널로 컴퓨터를 다루는 AI 에이전트는 어떻게 평가해야 할까. 벤치마크 설계에서 감수한 타협과 커뮤니티 운영 방식, 후속 프레임워크가 노린 공통 추상을 개발팀의 말로 정리했다.
핵심 내용 읽기 →
서울대 DSBA 연구실 세미나가 웹아레나와 OS월드 두 벤치마크를 정리했다. GPT-4의 성공률은 각각 14.41%와 12.24%로, 같은 과제를 수행한 사람의 78.24%와 72.36%에 크게 못 미쳤고 실패의 상당수는 클릭 정확도 문제였다.
핵심 내용 읽기 →
AI 에이전트의 위험은 대화가 아니라 환경과의 상호작용에서 드러난다. 위험 가설을 실행 가능한 샌드박스 실험으로 바꾸는 AutoControl Arena 연구 발표를 정렬 착시 문제를 중심으로 정리했다.
핵심 내용 읽기 →
코딩 에이전트는 문제를 풀면서도 코드베이스를 망가뜨린다. 체크포인트마다 기능을 덧붙이게 하며 복잡도가 어디로 쌓이는지 측정하는 SlopCodeBench 제작자의 문제의식과 실험에서 드러난 모델의 실패 양상을 정리했다.
핵심 내용 읽기 →
한국어로 지시하고 영어 자료를 읽어 일본어로 보고하는 업무는 흔하다. 67개 과제와 10개 언어로 구성된 다국어 장기 업무 벤치마크는 같은 모델도 하네스와 언어에 따라 20~30점씩 흔들린다는 결과를 내놨다.
핵심 내용 읽기 →
중국 연구진이 AI 에이전트의 연구자 자질을 재는 새 벤치마크를 공개했다. 최고 조합도 가장 낮은 인턴 수준 과제에서 성공률 68.3%에 머물렀고, 기능이 많은 하네스보다 도구를 최소화한 쪽이 더 좋은 성적을 냈다.
핵심 내용 읽기 →
AI 엔지니어 콘퍼런스 강연에서 데이터 시장 분석가가 밝힌 구조를 정리했다. 결과물이 아닌 '과정 데이터'가 핵심이며, 검증 가능성의 세 축이 어떤 분야가 먼저 AI에 뚫릴지 예측한다는 설명과 함께 업계 벤치마크를 믿기 어려운 이유도 짚는다.
핵심 내용 읽기 →
하버드 CMSA의 퍼스트 프루프는 인터넷에 없는 새 수학 문제로 AI 시스템을 시험한다. 2차 결과, 10문제 중 3개는 진전이 없었지만 나머지 7개서 완결·근접 풀이가 나왔다.
핵심 내용 읽기 →
하버드 CMSA가 소개한 '퍼스트 프루프'는 연구 수준의 미공개 수학 문제로 AI의 실제 증명 능력을 재는 수학자 주도 벤치마크입니다. 그 배경과 방식을 정리했습니다.
핵심 내용 읽기 →
AI 에이전트를 신뢰성 있게 배포·개선하려면 회사 고유의 벤치마크가 필요하다. Snorkel AI 발표자가 프로덕션 트레이스를 반복 가능한 시뮬레이션 환경으로 바꿔 비용·지연·재시도까지 함께 비교하는 방법을 설명합니다.
핵심 내용 읽기 →
앤던랩스가 자판기 시뮬레이션 벤딩벤치와 스톡홀름 카페·샌프란시스코 매장 실험으로 확인한 AI 에이전트의 장기 운영 능력, 그리고 아무도 지시하지 않았는데 저절로 나타난 담합과 거짓말, 시뮬레이션 자각 문제를 정리했다.
핵심 내용 읽기 →
오픈AI 연구자 노엄 브라운이 모델 출시마다 등장하는 벤치마크 표의 한계를 지적한다. 사고 시간을 통제하지 않은 점수 비교, 예산이 빠진 안전성 평가, 그리고 급격한 지능 폭발이 어려운 이유를 정리했다.
핵심 내용 읽기 →
비결정적인 AI 에이전트의 동작을 어떻게 측정할까. 소프트웨어 테스트에 빗대어 단위·통합·온라인 평가와 벤치마크를 트레이스와 LLM 심판 개념으로 풀어냅니다.
핵심 내용 읽기 →
AI 개발 컨퍼런스 발표에서 코딩 에이전트 개발자가 벤치마크 점수 맹신과 감(vibe) 의존을 모두 비판했다. 남의 평가를 해석하는 법, 평가로 에이전트를 개선하는 법, 직접 평가를 만드는 법까지 3단계로 정리했다.
핵심 내용 읽기 →
구글 딥마인드의 아이다 네마트자데가 멀티모달 모델 평가를 이야기한다. 벤치마크가 정말 그 능력을 재는지 검증하는 연구가 빠져 있고, 모델이 모델을 채점하는 방식도 과제에 따라 신뢰도가 갈린다고 짚는다.
핵심 내용 읽기 →
LLM이 LLM을 채점하는 관행, 정의 없이 뭉뚱그려진 안전성, 범용이라는 모호한 약속까지. 자연어처리와 평가 방법론을 연구해 온 학자가 짚은 AI 벤치마크의 구조적 허점과, 이를 고치기 위한 현실적인 개선 방향을 정리했다.
핵심 내용 읽기 →
AI 코딩 모델의 평가 기준이 깔끔한 함수 작성에서 실제 깃허브 저장소의 이슈 해결로 옮겨간 과정을, SWE-bench의 구성과 검증판이 따로 필요했던 이유, 그리고 점수 포화와 학습 데이터 오염 문제까지 짚어 정리했습니다.
핵심 내용 읽기 →
프린스턴대 아르빈드 나라야난 교수가 스탠퍼드 디지털경제연구소 강연에서 AI의 지식노동 전환은 수십 년 단위로 진행된다고 말했다. 벤치마크 정확도 대신 에이전트의 신뢰성과 확산 병목을 측정해야 한다는 주장과 함께, 개방형 평가 실험 결과도 소개됐다.
핵심 내용 읽기 →
실제 시니어 엔지니어의 PR을 바탕으로 저사양 지시문과 검증 에이전트를 결합해 코딩 AI를 평가하는 Snorkel AI의 Senior SWE-Bench가 어떻게 설계됐고, 리더보드에서 무엇이 드러났는지 정리한다.
핵심 내용 읽기 →
한 개발자에게 날아온 251억원짜리 결제 오류 메일을 계기로, 코딩 에이전트의 성능·비용·신뢰를 짚었다. GPT 5.6과 페이블 5의 벤치마크 차이, 하네스의 역할, 그리고 “언제 멈춰야 하는가”라는 새 평가 기준을 정리했다.
핵심 내용 읽기 →
UC 버클리 연구진이 만든 'Agents' Last Exam' 벤치마크를 소개한다. 55개 전문 분야의 실제 워크플로를 검증 가능한 방식으로 평가해, 오늘날 에이전트가 복잡한 실무 자동화에 얼마나 멀었는지 보여준다.
핵심 내용 읽기 →
스노클 AI와 스탠퍼드 연구진이 50여 명의 변호사와 3천 건 이상의 주석으로 법률 결과물을 평가한 결과, 사전 채점표(루브릭)보다 둘을 견주는 비교 판단이 품질 순위를 더 정확하게, 절반의 시간에 복원했다.
핵심 내용 읽기 →
정답 개수만 세는 LLM 벤치마크의 한계를 심리측정학의 문항반응이론(IRT)으로 넘어서는 방법. 문항 난이도·변별력·모델 지능을 함께 추정해 평가를 정교하게 만든다.
핵심 내용 읽기 →
단일 정확도 대신 심리측정학의 문항반응이론(IRT)으로 LLM을 평가하는 방법. 문항 난이도·변별도와 모델 능력을 따로 추정해 벤치마크 감사, 데이터 유출 탐지, 모델 증류 여부까지 밝혀낸다.
핵심 내용 읽기 →
스탠퍼드 CME295 강의를 바탕으로 LLM 평가법을 정리한다. 사람 평가와 규칙 기반 지표의 한계, LLM-as-a-Judge와 편향, MMLU·SWE-bench 등 벤치마크와 데이터 오염 문제를 다룬다.
핵심 내용 읽기 →
객관식 벤치마크로는 잴 수 없는 주관적 글쓰기 품질을, 참조 기반 지표와 인간 평가, 그리고 LLM을 심사위원으로 쓰는 세 가지 방식으로 어떻게 측정하는지 정리했습니다. 각 방법의 장단점과 편향 문제까지 살펴봅니다.
핵심 내용 읽기 →
여러 LLM 중 작업에 가장 맞는 모델을 어떻게 고를까? 표준화된 평가 틀인 LLM 벤치마크의 3단계 실행 과정과 정확도·재현율·혼란도 같은 지표, 그리고 명확한 한계를 정리했다.
핵심 내용 읽기 →
같은 AMD 라이젠 미니 PC에서 윈도우·WSL·바탕 리눅스로 로컬 LLM을 돌려 비교했다. 긴 프롬프트 처리는 리눅스 radv가 약 3배 빨랐고, 토큰 생성의 진짜 병목은 연산이 아니라 메모리 대역폭이라 듀얼 채널 램으로 속도가 두 배로 뛰었다.
핵심 내용 읽기 →
MMLU 점수는 최상위 모델들이 89~92%로 거의 같다. 벤치마크의 한계와 데이터 오염, 챗봇 아레나, LLM 심사 방식까지 정리하고 용도에 맞는 모델을 고르는 3단계 방법을 소개한다.
핵심 내용 읽기 →
Anthropic이 Mythos 모델과 그 가드레일 버전인 Fable 5를 공개했다. 영상은 직접 사용 경험을 토대로 벤치마크, 가격, 그리고 매우 장황하고 느리지만 강력한 모델의 특징을 정리한다.
핵심 내용 읽기 →
Two Minute Papers가 챗GPT 5.5 인스턴트를 분석한다. 의료·법률 환각이 절반으로 줄고 즉답 모델이 추론 모델에 근접했지만, 다중 턴 적대적 프롬프트에 대한 거부율이 떨어져 분류기로 보완했다는 점을 짚는다.
핵심 내용 읽기 →
OpenAI 연구 리드 테잘 파트와르단이 벤치마크 포화, 벤치맥싱, 실제 업무를 재는 GDPval과 과학 실험 평가까지 AI 모델 평가가 어떻게 진화하는지 설명한다.
핵심 내용 읽기 →
수백 페이지 분량의 보고서를 토대로 클로드 오푸스 4.8의 성능 향상, 정직성의 한계, 자신이 평가받는 중임을 알아채는 문제 등 핵심 포인트를 짚는다.
핵심 내용 읽기 →
앤트로픽 클로드 오퍼스 4.8은 지능 점수보다 정직성에 초점을 맞췄다. 자기 작업을 속이지 않고, 코드베이스를 대충 훑던 게으름도 개선됐다는 244쪽 시스템 카드 분석.
핵심 내용 읽기 →