LEXam 벤치마크 분석: 로스쿨 시험 340개로 측정한 대형 언어 모델의 법률 추론 한계
로스쿨 시험 340개에서 뽑은 문항으로 대형 언어 모델 26개를 평가한 LEXam 연구 발표를 정리했다. 오답 보기를 늘리기만 해도 정확도가 절반으로 떨어졌고, 추론 시간을 늘려도 성능은 나아지지 않았다.
핵심 내용 읽기 →AI TOPIC
법률AI 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

로스쿨 시험 340개에서 뽑은 문항으로 대형 언어 모델 26개를 평가한 LEXam 연구 발표를 정리했다. 오답 보기를 늘리기만 해도 정확도가 절반으로 떨어졌고, 추론 시간을 늘려도 성능은 나아지지 않았다.
핵심 내용 읽기 →
미국 법률 시스템을 겨냥한 LawLLM 논문 해설. 글자만 비슷한 유사 판례와 구속력 있는 선례를 분리해 지식 그래프로 학습시키고, 판결 예측 정확도 79.4%와 환각률 0.1%를 이끌어낸 과정을 정리했다.
핵심 내용 읽기 →
스노클 AI와 스탠퍼드 연구진이 50여 명의 변호사와 3천 건 이상의 주석으로 법률 결과물을 평가한 결과, 사전 채점표(루브릭)보다 둘을 견주는 비교 판단이 품질 순위를 더 정확하게, 절반의 시간에 복원했다.
핵심 내용 읽기 →