실행 기반 AI 연구 자동화: 아이디어를 GPU로 돌려 검증한 스탠퍼드 연구, 진화 탐색은 되고 RL은 막혔다
AI가 낸 연구 아이디어는 심사에서 사람보다 높은 점수를 받았지만 실제로 실험을 돌리자 점수가 6.0에서 4.13으로 무너졌다. 스탠퍼드 연구팀이 아이디어를 자동으로 코드로 옮겨 GPU에서 검증하는 환경을 만들고 무엇이 통했는지 정리했다.
핵심 내용 읽기 →AI TOPIC
AI 연구자동화 관련 핵심 뉴스와 활용 인사이트 7편을 최신순으로 모았습니다.

AI가 낸 연구 아이디어는 심사에서 사람보다 높은 점수를 받았지만 실제로 실험을 돌리자 점수가 6.0에서 4.13으로 무너졌다. 스탠퍼드 연구팀이 아이디어를 자동으로 코드로 옮겨 GPU에서 검증하는 환경을 만들고 무엇이 통했는지 정리했다.
핵심 내용 읽기 →
제안·구현·실행·검증·학습·선택으로 이어지는 연구 루프에서 기계가 차지한 자리는 어디까지 왔을까. 같은 주에 나온 두 편의 공개 자료와 모델 안전장치를 둘러싼 논란을 하나의 이야기로 엮어, 자동화가 어디부터 도착하는지 읽어본다.
핵심 내용 읽기 →
PPO 논문 리젝부터 ICML 2만 3천 편 투고와 AI 대필 리뷰까지, AI 시대에 흔들리는 학계 평가 시스템을 짚는다. 이어 IMO 금메달과 실제 수학 연구의 간극, RLVR로 닿기 어려운 영역까지 정리했다.
핵심 내용 읽기 →
미공개 학회 논문의 핵심 질문만 주고 AI에게 3천 달러와 6일을 맡긴 실험. 문헌 조사와 코드 작성, 고장 난 서버 복구까지 해냈지만 실험 설계와 경로 수정, 지시 유지, 자원 관리에서 무너져 6점 만점에 1점을 받았다.
핵심 내용 읽기 →
딥마인드 로보틱스 출신 에릭 장이 수천 달러의 컴퓨팅만으로 알파고를 다시 구현하며 배운 것들. 정책망과 가치망이 탐색을 어떻게 줄이는지, 그리고 몬테카를로 트리 탐색이 왜 오늘날 LLM 강화학습보다 표본 효율이 높은지 짚는다.
핵심 내용 읽기 →
수학자 테런스 타오는 AI가 아이디어 생성 비용을 거의 0으로 낮췄고 병목은 검증으로 옮겨갔다고 말한다. 에르되시 문제 성적표와 실제 생산성 변화, 앞으로의 인간·AI 협업 방식까지 대담 내용을 정리했다.
핵심 내용 읽기 →
스탠퍼드 연구진이 만든 생물의학 AI 에이전트가 25개 분야 도구를 스스로 조합해 희귀질환 진단 시간을 110분에서 3분으로 줄였다. 성능과 한계를 정리했다.
핵심 내용 읽기 →