LLM이 아직 과학자가 아닌 이유: 자율 연구 에이전트에서 반복 관찰된 여섯 가지 실패 유형
아이디어 발상부터 논문 작성까지 맡긴 멀티 에이전트 실험에서 네 개 주제 중 하나만 완주했다. 연구진은 학습 데이터 편향과 구현 표류, 과장 습관 등 여섯 가지 실패 유형을 정리해 공개했다. 심사자 역할을 맡겼을 때도 같은 문제가 반복됐다.
핵심 내용 읽기 →AI TOPIC
LLM 한계 관련 핵심 뉴스와 활용 인사이트 5편을 최신순으로 모았습니다.

아이디어 발상부터 논문 작성까지 맡긴 멀티 에이전트 실험에서 네 개 주제 중 하나만 완주했다. 연구진은 학습 데이터 편향과 구현 표류, 과장 습관 등 여섯 가지 실패 유형을 정리해 공개했다. 심사자 역할을 맡겼을 때도 같은 문제가 반복됐다.
핵심 내용 읽기 →
미공개 학회 논문의 핵심 질문만 주고 AI에게 3천 달러와 6일을 맡긴 실험. 문헌 조사와 코드 작성, 고장 난 서버 복구까지 해냈지만 실험 설계와 경로 수정, 지시 유지, 자원 관리에서 무너져 6점 만점에 1점을 받았다.
핵심 내용 읽기 →
3Blue1Brown의 그랜트 샌더슨이 AI의 수학 진전을 짚는다. 점수로 잴 수 없는 추측과 정의 만들기, 갈루아의 100년 검증 루프, 검증 가능성 너머의 반복 가능성과 린의 역할, 수학자의 역할 변화까지 다룬다.
핵심 내용 읽기 →
인지 아키텍처 Soar를 40년간 개발해 온 존 레어드가 절차·의미·일화 기억을 나누는 설계, LLM의 온라인 지속 학습 부재, 학습 분포를 벗어나면 무너지는 한계, 그리고 신진 연구자를 위한 조언까지 짚는다.
핵심 내용 읽기 →
AI가 그럴듯한 거짓 정보를 만들어내는 '환각' 현상은 왜 생길까. 마이크로소프트 개발자가 설명하는 거대 언어 모델의 확률적 본질과 RAG로 줄이되 없애지는 못하는 이유를 정리했다.
핵심 내용 읽기 →