AI TOPIC

AI 안전 최신 뉴스와 핵심 해설

AI 안전 관련 핵심 뉴스와 활용 인사이트 271편을 최신순으로 모았습니다.

앤스로픽이 출시를 보류한 AI '클로드 미토스', 300쪽 문서가 남긴 숙제 영상 썸네일
80,000 Hours

클로드 미토스 시스템 카드 정리: 앤스로픽이 출시를 보류한 이유와 정렬 평가의 한계

앤스로픽이 일반 공개를 보류한 모델 클로드 미토스의 시스템 카드 300여 쪽을 해설한 영상을 정리했다. 오래된 취약점을 찾아내는 공격 능력, 역대 가장 좋았다는 정렬 평가 결과, 그리고 그 결과를 그대로 믿기 어렵게 만드는 세 가지 문제를 차례로 짚는다.

핵심 내용 읽기 →
AI 에이전트는 간접 프롬프트 인젝션에 얼마나 취약한가 — 20만 건 공개 대회가 남긴 것 영상 썸네일
AI Safety Poland

간접 프롬프트 인젝션 대회 결과 정리: AI 에이전트 공격 성공률과 모델별 취약점 비교

20만 건이 넘는 공격 시도를 모은 간접 프롬프트 인젝션 공개 대회 결과를 정리했다. 도구 사용과 코딩, 컴퓨터 사용 환경별 공격 성공률과 에이전트의 은폐 행동, 견고한 모델을 뚫은 공격이 다른 모델로 전이되는 현상, 가드레일 분류기의 한계까지 짚는다.

핵심 내용 읽기 →
AI가 가치에 정렬됐다는 말, 실제로는 어떻게 검증하나 영상 썸네일
AI Evaluation Programme: Capabilities and Safety

AI 가치 정렬 평가 방법 정리 - 객관식 벤치마크의 한계와 생성형 동적 평가, 자기진화형 검사로의 전환

AI가 인간의 가치와 정렬됐는지를 실제로 어떻게 검증하는지 다룬 공개 세미나를 정리했다. 객관식 벤치마크의 타당성·정보량·포화 문제, 행동을 관찰하는 생성형 동적 평가, 문항반응이론을 결합한 자기진화형 평가를 설명한다.

핵심 내용 읽기 →
AI에게 살상 결정을 맡길 것인가 — 앤트로픽과 미 국방부가 충돌한 마감일 영상 썸네일
AI Explained

앤트로픽 미 국방부 충돌 정리: 자율 AI 무기와 대량 감시 요구, 그리고 에이전트 신뢰성 논쟁

미 국방부가 앤트로픽에 클로드의 군사적 사용 제한을 풀라고 요구하며 마감일을 통보했다. 자율 살상 무기와 자국민 대상 대량 감시가 쟁점인데, 앤트로픽이 앞세운 거부 논리는 윤리가 아니라 'AI 에이전트가 아직 충분히 신뢰할 수 없다'는 기술적 판단이었다.

핵심 내용 읽기 →
트랜스포머 안에는 '믿음의 기하학'이 있다 — 해석가능성을 과학으로 만들려는 시도 영상 썸네일
FAR․AI

트랜스포머 내부 표현의 기하학과 해석가능성 — 심플렉스 애덤 샤이의 FAR.AI 강연 정리

FAR.AI 강연에서 심플렉스의 애덤 샤이가 다음 토큰 예측 학습이 트랜스포머 내부에 어떤 기하학적 믿음 구조를 만드는지 설명했다. 합성 데이터 실험에서 예측된 프랙탈 구조가 잔차 스트림에서 확인됐고, 표현이 직교 부분공간으로 분해되는 경향도 관찰됐다.

핵심 내용 읽기 →