프롬프트 지시 개수 한계 실험: 80개에서 완벽 준수율이 0이 되고 긴 맥락에선 답변 거부가 치솟았다
지시를 몇 개까지 넣을 수 있는지, 마크다운이 정말 더 나은지, 긴 맥락에서 무엇이 먼저 무너지는지를 다섯 개 모델과 1만 회가 넘는 호출로 잰 통제 실험 논문입니다. 결론은 환각이 아니라 답변 거부였습니다.
핵심 내용 읽기 →AI TOPIC
긴맥락 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

지시를 몇 개까지 넣을 수 있는지, 마크다운이 정말 더 나은지, 긴 맥락에서 무엇이 먼저 무너지는지를 다섯 개 모델과 1만 회가 넘는 호출로 잰 통제 실험 논문입니다. 결론은 환각이 아니라 답변 거부였습니다.
핵심 내용 읽기 →
AI가 자주 환각을 일으킨다는 말부터 에이전트가 완전 자율로 일한다는 말까지, IBM이 흔히 퍼진 AI 오해 다섯 가지를 최신 모델 기준으로 짚어 진실을 설명한다.
핵심 내용 읽기 →