프롬프트 지시 개수 한계 실험: 80개에서 완벽 준수율이 0이 되고 긴 맥락에선 답변 거부가 치솟았다
지시를 몇 개까지 넣을 수 있는지, 마크다운이 정말 더 나은지, 긴 맥락에서 무엇이 먼저 무너지는지를 다섯 개 모델과 1만 회가 넘는 호출로 잰 통제 실험 논문입니다. 결론은 환각이 아니라 답변 거부였습니다.
핵심 내용 읽기 →AI TOPIC
AI 논문 리뷰 관련 핵심 뉴스와 활용 인사이트 5편을 최신순으로 모았습니다.

지시를 몇 개까지 넣을 수 있는지, 마크다운이 정말 더 나은지, 긴 맥락에서 무엇이 먼저 무너지는지를 다섯 개 모델과 1만 회가 넘는 호출로 잰 통제 실험 논문입니다. 결론은 환각이 아니라 답변 거부였습니다.
핵심 내용 읽기 →
모델 파라미터를 토큰처럼 취급해 재학습 없이 트랜스포머를 키우겠다는 토큰포머 논문을, 0 초기화로 규모를 늘리는 설계부터 실험 곡선에 숨은 허점과 원조 피드포워드 구조와의 유사성까지 짚으며 비판적으로 뜯어봤다.
핵심 내용 읽기 →
주식 판단을 AI 하나가 아니라 역할을 나눈 AI 팀에게 맡긴 트레이딩에이전트 연구. 강세파와 약세파가 토론하고 리스크 팀이 다시 걸러내는 4단계 구조와, 애플·구글·아마존 세 종목 백테스트에서 드러난 성과와 한계를 정리했다.
핵심 내용 읽기 →
서울대 DSBA 연구실이 정리한 'AI 사이언티스트'. 아이디어 50개를 만들어 참신성을 걸러내고 실험과 집필, 자동 피어리뷰까지 사람 없이 도는 구조와, 논문 한 편 15달러라는 비용, 그리고 남은 한계를 짚었다.
핵심 내용 읽기 →
거대 언어 모델을 로봇에 넣은 연구 904편을 훑어 실제 사람과 마주 보고 검증한 86편만 남긴 CHI 2026 체계적 리뷰. 로봇이 사람을 읽고 맞춰가는 방식이 어떻게 바뀌었는지, 그리고 무엇이 아직 빈칸으로 남았는지 정리했다.
핵심 내용 읽기 →