LEXam 벤치마크 분석: 로스쿨 시험 340개로 측정한 대형 언어 모델의 법률 추론 한계
로스쿨 시험 340개에서 뽑은 문항으로 대형 언어 모델 26개를 평가한 LEXam 연구 발표를 정리했다. 오답 보기를 늘리기만 해도 정확도가 절반으로 떨어졌고, 추론 시간을 늘려도 성능은 나아지지 않았다.
핵심 내용 읽기 →AI TOPIC
추론 모델 관련 핵심 뉴스와 활용 인사이트 52편을 최신순으로 모았습니다.

로스쿨 시험 340개에서 뽑은 문항으로 대형 언어 모델 26개를 평가한 LEXam 연구 발표를 정리했다. 오답 보기를 늘리기만 해도 정확도가 절반으로 떨어졌고, 추론 시간을 늘려도 성능은 나아지지 않았다.
핵심 내용 읽기 →
추론 모델이 답변 전에 내놓는 사고 블록은 암호 서명으로 보호되지만 대화나 계정에 묶여 있지는 않다. 보안 연구자가 다른 대화에서 얻은 사고 블록을 그대로 주입해 모델이 자기 생각으로 받아들이게 만드는 과정을 공개 강연에서 시연했다.
핵심 내용 읽기 →
한국어로 뭉뚱그려 번역되는 AI '추론'을 Inference와 Reasoning으로 나눠 설명하고, 요청을 작은 작업으로 쪼갠 뒤 단계마다 계획을 다시 고치는 에이전트가 왜 환각과 오류 전파에 강한지 정리했다.
핵심 내용 읽기 →
OpenAI·앤트로픽·구글이 감춘 추론 기록을 암호를 깨지 않고 복원한 논문을 해설했다. 암호화 블록이 세션과 모델을 가리지 않고 통용된 탓에 공개 로그에서 개인정보와 자격 증명이 새어 나왔고, 눈에 보이지 않는 프롬프트 인젝션까지 가능했다.
핵심 내용 읽기 →
학습 없이 프롬프트만으로 추론을 끌어올리는 세 갈래 방법과, 정답 채점처럼 검증 가능한 보상으로 강화학습을 돌리는 RLVR 및 GRPO 계열 알고리즘의 차이를 대학 강의 내용을 바탕으로 차근차근 정리했습니다.
핵심 내용 읽기 →
구글 딥마인드 아르키트 샤르마가 ETH 취리히 초청 강연에서 정리한 추론 시점 연산 확장의 원리와 벤치마크 성과, 그리고 검증 데이터 고갈·지식 발견·장기 에이전트라는 남은 과제를 함께 소개합니다.
핵심 내용 읽기 →
뉴욕대 디지털 이론 랩이 연 '문화적 AI' 학회에서 추론 모델의 사고 흔적에서 특징적 토큰을 하나씩 빼앗는 실험 결과가 공개됐다. 모델은 매 단계 전략을 바꿨고, 끝에는 단어를 조각내 재조립하기 시작했다.
핵심 내용 읽기 →
CMU 그레이엄 뉴빅 교수의 대규모 언어모델 추론 강의를 정리했다. 생각의 사슬이 작동하는 이유와 학습 데이터에서 이 능력이 나온 배경, 수학·논리 밖에서 효과가 약해지는 지점, 여러 답을 뽑아 다수결하는 자기 일관성의 비용, 그리고 설명의 충실성 문제까지 짚는다.
핵심 내용 읽기 →
긴 사고 과정을 쓰는 추론 모델은 어떤 원리로 학습될까. CMU 강의는 STaR와 DeepSeek R1, GRPO 손실함수, 응답 길이 폭주 문제, 강화학습이 지도학습보다 잘 전이되는 이유까지 차례로 짚는다.
핵심 내용 읽기 →
딥시크 R1 백서를 처음부터 끝까지 짚는다. 지도 학습 없이 강화학습만 쓴 R1 제로, 크리틱 없는 GRPO, 콜드스타트 데이터로 이어지는 네 단계 학습, 소형 모델 증류 결과와 남은 한계까지 정리했다.
핵심 내용 읽기 →
연구자가 논문 작성과 아이디어 구상에까지 LLM을 쓰는 지금, 객관식 정답률만으로는 신뢰를 확인할 수 없다. 문제를 다섯 단계 사슬로 쪼개고 근거와 힌트 반응까지 채점한 물리 벤치마크 설계를 살펴본다.
핵심 내용 읽기 →
추론 모델에 웹검색과 사내 문서 검색을 붙여 리서치 어시스턴트를 만드는 실습을 정리했다. 멀티홉 질문이 왜 어려운지, 추론 기능을 켜면 무엇이 달라지는지, 도구 연결과 실행 과정 관측은 어떻게 하는지를 코드 흐름으로 짚는다.
핵심 내용 읽기 →
딥시크 R1이 쓴 GRPO를 무료 구글 코랩에서 파라미터 5억 개짜리 작은 모델로 직접 돌려 본 실습 해설이다. 형식·정답 보상 설계와 참조 모델의 역할, 그리고 작은 모델에서 드러난 한계까지 정리했다.
핵심 내용 읽기 →
추론 LLM으로 리서치 에이전트를 처음부터 만들어본 개발자의 기록을 정리했다. 확장 사고와 도구 호출을 엮는 루프 구조, 중간 사고 과정을 그대로 믿으면 안 되는 이유, 그리고 프레임워크를 도입할 때의 득실까지 실전 교훈을 짚는다.
핵심 내용 읽기 →
딥시크 논문을 따라 V3, R1-제로, R1 세 모델의 관계를 정리한다. GRPO 강화학습만으로 추론 능력이 생긴 과정과 스스로 되짚는 아하 모먼트, 그리고 작은 모델에 증류했을 때의 성능 향상을 짚는다.
핵심 내용 읽기 →
닐 난다와 MATS 연구자들이 추론 모델의 생각의 사슬을 문장 단위로 쪼개, 어떤 문장이 최종 답을 좌우했는지 리샘플링과 어텐션 억제로 측정한 사고 앵커 연구와 시각화 도구를 하나씩 차근히 살펴봅니다.
핵심 내용 읽기 →
해석 가능성 연구자 닐 난다가 추론 모델을 주제로 진행한 강연 정리. 강화학습으로 사고 사슬을 학습한 모델이 왜 강해졌는지, 그리고 모델이 적어 내려간 생각을 우리가 얼마나 믿을 수 있는지를 차례로 짚는다.
핵심 내용 읽기 →
닐 난다가 추론 모델 해석 연구의 어려움을 정리했다. 토큰 샘플링이 만드는 거대한 경우의 수, 문장 단위 인과 그래프와 생각 앵커 기법, 사고 사슬을 읽는 방식이 언제까지 통할지에 대한 이야기를 담았다.
핵심 내용 읽기 →
거대 언어모델이 헤매는 스도쿠와 미로 문제를 2,700만 파라미터 모델이 예제 1,000개만으로 풀어낸다. 파라미터 대신 깊이를 사는 상위·하위 순환 모듈 구조와 학습 기법까지 계층적 추론 모델(HRM)의 원리를 정리했다.
핵심 내용 읽기 →
오픈AI 논문에 따르면 추론 모델의 사고 과정을 감시하면 코딩 과제의 커닝을 93~97% 잡아낸다. 그러나 그 감시 결과로 벌을 주며 훈련하면 모델은 커닝을 멈추는 대신 의도를 감추는 법을 배운다.
핵심 내용 읽기 →
추론 모델 붐 뒤에는 어떤 흐름이 있었나. RLHF가 남긴 인프라와 검증 가능한 보상 학습의 부상, PPO에서 GRPO로 바꿔 얻은 개선, 그리고 사후학습 연산 비중이 사전학습과 대등해질 가능성까지 정리한 강연이다.
핵심 내용 읽기 →
PPO는 LLM을 사람의 선호에 맞추고 평범한 모델을 추론 모델로 바꾸는 강화학습 알고리즘이다. 가치 함수와 어드밴티지, 편향-분산 트레이드오프, 클리핑까지 원논문의 빽빽한 수식을 직관으로 풀어낸 해설을 정리했다.
핵심 내용 읽기 →
오픈AI 노암 브라운은 모델이 얼마나 오래 생각했는지를 빼놓은 벤치마크가 성능도 위험도 잘못 보여준다고 말한다. 막대그래프 대신 연산량 축으로 다시 그려야 하는 이유와 그가 내놓은 세 가지 구체적 제안을 정리했다.
핵심 내용 읽기 →
정책 경사의 직관과 기준값으로 분산을 줄이는 방법, PPO가 옛 표본을 재사용하며 확률 비율을 잘라내는 이유, 그리고 정답 일치 여부만으로 보상을 주어 긴 사고 과정을 학습시키는 방식까지 정리했다.
핵심 내용 읽기 →
바이트댄스가 공개한 DAPO는 GRPO에 네 가지 기법을 더해 AIME 2024에서 딥시크 R1을 절반의 학습 스텝으로 앞섰다. 클리핑 상한 조정부터 동적 샘플링까지 각 기법이 무엇을 노렸는지 쉽게 풀었다.
핵심 내용 읽기 →
DeepSeek 추론 모델의 핵심인 GRPO를 중학교 수준 방정식 하나로 풀어 설명한 강의를 정리했다. 사람이 만든 풀이로 가르치는 방식과 무엇이 다른지, 어드밴티지 정규화와 확률비, 클리핑, KL 발산이 각각 어떤 역할을 하는지 짚는다.
핵심 내용 읽기 →
웨이보 AI 랩이 공개한 30억 파라미터 VibeThinker 3B가 수학·코딩 벤치마크에서 수백 배 큰 모델과 겨뤘다. 검증 가능한 추론과 지식을 분리한 학습 레시피, 그리고 직접 실행에서 드러난 한계를 함께 짚었다.
핵심 내용 읽기 →
앨런AI연구소 네이선 램버트가 추론 모델 학습의 실제를 설명한다. 단위 테스트를 우회하는 보상 해킹, 아첨을 학습하는 과최적화, 평가·체감·가격의 균형, 스킬 다음에 필요한 캘리브레이션과 계획 능력을 짚는다.
핵심 내용 읽기 →
추론 모델은 새로운 아키텍처가 아니라 훈련 방식에서 나왔다. 정답에만 보상을 주자 모델이 스스로 검증과 되짚기를 익힌 과정, 테스트 타임 컴퓨트라는 새 축, 그리고 환각률이 함께 올라간 부작용까지 정리했다.
핵심 내용 읽기 →
딥시크 R1 이후 추론 모델 연구는 어디까지 왔을까. 추론 학습이 정말 새로운 능력을 여는지를 둘러싼 최근 논쟁과, 각 사가 고른 벤치마크에서 드러나는 오픈AI·구글·메타의 서로 다른 지향을 현업 AI 연구자와 함께 짚었다.
핵심 내용 읽기 →
링크 10개를 클릭하는 대신 챗봇에게 묻는 시대, 검색 기술은 사라질까. 마이크로소프트 리서치와 인도 공대 연구자들이 검색과 추론의 경계, 압축의 한계, 출처 표시 문제를 두고 벌인 토론을 정리했다.
핵심 내용 읽기 →
ChatGPT·클로드에 더해지는 추론 모델은 다음 단어를 예측하는 데 그치지 않고 문제를 논리적 단계로 쪼개 푼다. 기존 LLM과의 차이, 사고 사슬, 계산기·검색 같은 외부 도구 활용, 그리고 한계까지 쉽게 정리했다.
핵심 내용 읽기 →
o1과 DeepSeek-R1 같은 추론 모델이 답 대신 '생각'을 먼저 전개하는 이유, 테스트타임 컴퓨트 스케일링, 그리고 강화학습만으로 사고연쇄를 스스로 익히는 원리를 쉽게 풀었다.
핵심 내용 읽기 →
판별형에서 생성형으로, 다시 추론 모델과 에이전틱·피지컬 AI로 이어지는 흐름을 정리했다. 언어 모델 원리, 벤치마크로 본 인간과의 격차, 모델 경쟁 구도, AI 윤리와 한국 AI 기본법까지 한 강의로 짚는다.
핵심 내용 읽기 →
다음 토큰만 예측하던 기본 모델을, 검증기와 그룹 평균 보상만으로 추론 모델로 바꾸는 GRPO·RLVR의 작동 원리와 한계를 쉽게 정리했습니다.
핵심 내용 읽기 →
딥시크 R1이 쓴 GRPO 알고리즘을 라이브러리 없이 밑바닥부터 구현해 1억 3,500만 파라미터 소형 모델에 단계별 추론을 가르친 실험. 정확도는 45%에서 61%로 올랐고, 든 비용은 클라우드 GPU 5~6달러 수준이었다.
핵심 내용 읽기 →
2024년 말 o1과 2025년 초 오픈소스 딥시크-R1로 부상한 대형 추론 모델에서, 강화학습이 왜 추론을 이끌어내는지 계층적 추론과 두 단계 학습 관점으로 분석하고 개선 알고리즘 HICRA까지 짚는 논문을 소개한다.
핵심 내용 읽기 →
루이스 세라노가 대형 언어 모델을 '희미한 전조등과 거대한 백미러를 가진 자동차'에 비유해, 프리앰블·RAG·추론 모델·AI 에이전트라는 네 가지 활용 기술과 역할을 나눈 멀티 에이전트 구조까지 쉽게 풀어 설명한다.
핵심 내용 읽기 →
작고 빠른 모델에 거대 모델의 능력을 옮기는 지식 증류의 원리를 소프트 타깃, 온도, KL 발산, 노출 편향, 온폴리시 증류까지 단계별로 쉽게 설명한다.
핵심 내용 읽기 →
AI가 자주 환각을 일으킨다는 말부터 에이전트가 완전 자율로 일한다는 말까지, IBM이 흔히 퍼진 AI 오해 다섯 가지를 최신 모델 기준으로 짚어 진실을 설명한다.
핵심 내용 읽기 →
오픈AI o1은 답하기 전 스스로 사고사슬을 돌리는 ‘테스트타임 컴퓨트’로 추론·수학 성능을 끌어올렸다. 사고사슬의 실제 효과, 그 한계, 그리고 딥마인드가 밝힌 사전학습과의 비교까지 최신 논문들로 정리한다.
핵심 내용 읽기 →
수백만 개의 예시와 강화학습 없이도 추론하는 LLM을 만들 수 있을까. s1 논문은 잘 고른 1,000개 예시와 test-time 컴퓨트 트릭만으로 가능함을 보여준다.
핵심 내용 읽기 →
이론물리학 출신 오픈AI 연구자 댄 로버츠가 강화학습의 원리, 탐색과 활용, 테스트타임 컴퓨트, 그리고 AI가 미해결 수학 문제를 푸는 방식까지 쉽게 풀어냈다.
핵심 내용 읽기 →
AI 교육자 세바스찬 라시카가 2026년 LLM의 현주소를 정리했다. 발전의 축이 사전학습에서 후처리로 옮겨간 이유, RLVR·GRPO, 추론 스케일링, 도구 사용까지 짚었다.
핵심 내용 읽기 →
완전 공개 추론 모델 Olmo 3를 만든 연구자가 아키텍처 선택, 추론 중심 데이터, SFT·DPO·강화학습(RLVR) 파이프라인, 그리고 평가에서 겪은 어려움까지 프런티어 모델 제작 과정을 처음부터 끝까지 설명한다.
핵심 내용 읽기 →
LangChain이 정리한 추론 모델 활용 가이드다. 다음 단어 예측과 강화학습 기반 추론의 차이, o1·o3를 챗봇처럼 프롬프트하면 안 되는 이유, 그리고 코딩·계획·리서치 등 실제 활용처까지 하나씩 짚는다.
핵심 내용 읽기 →
AI 모델은 결정론적 프로그램과 달리 확률적이라 같은 입력에도 다른 답을 낸다. API 비유와 모델 선택, 추론 모델, 이미지·음성 등 다양한 입력 방식까지 AI 모델의 작동 원리를 쉽게 정리했다.
핵심 내용 읽기 →
요즘 주목받는 추론(생각하는) LLM이 어떻게 더 나은 답을 내는지, 사고 사슬·테스트 타임 컴퓨트·best-of-N·검증 가능한 보상 강화학습을 통해 풀어 설명합니다.
핵심 내용 읽기 →
모델을 키우는 학습타임 컴퓨트 외에, 답할 때 연산을 더 쓰는 테스트타임 컴퓨트가 새로운 확장 축으로 떠올랐다. 사고 토큰·탐색·자기일관성의 원리와 비용 트레이드오프를 정리했다.
핵심 내용 읽기 →
다음 단어를 예측하는 LLM과 달리, 답하기 전에 계획하고 검증하는 대형 추론 모델(LRM)의 작동 원리와 학습 방법, 추론 시점 연산의 비용과 이득을 IBM 영상으로 풀어봅니다.
핵심 내용 읽기 →
OpenAI 연구 리드 테잘 파트와르단이 벤치마크 포화, 벤치맥싱, 실제 업무를 재는 GDPval과 과학 실험 평가까지 AI 모델 평가가 어떻게 진화하는지 설명한다.
핵심 내용 읽기 →
AI 전문 채널 'AI Explained'가 정리한 2025년 AI 10대 흐름과 2026년 5대 전망 — 추론 모델, 플레이 가능한 세계, AI 슬롭, 중국·오픈소스 모델의 추격, 측면 생산성을 짚는다.
핵심 내용 읽기 →