모델 디핑 입문: 두 모델의 활성값 차이로 미세조정의 흔적을 읽어내는 해석가능성 연구
두 모델의 활성값 차이만 봐도 무엇을 미세조정했는지 첫 토큰부터 드러난다는 연구와, 크로스코더가 만들어낸 가짜 챗 전용 특징의 원인을 밝혀 바로잡은 후속 연구를 연구자들의 대담을 바탕으로 정리했다.
핵심 내용 읽기 →AI TOPIC
LLM 연구 관련 핵심 뉴스와 활용 인사이트 4편을 최신순으로 모았습니다.

두 모델의 활성값 차이만 봐도 무엇을 미세조정했는지 첫 토큰부터 드러난다는 연구와, 크로스코더가 만들어낸 가짜 챗 전용 특징의 원인을 밝혀 바로잡은 후속 연구를 연구자들의 대담을 바탕으로 정리했다.
핵심 내용 읽기 →
AI가 답변을 넘어 실제 행동에 나서면서 안전장치의 조건도 달라졌다. IASEAI 2026 세션에서 발표된 회복형 가드레일, 스티어링 부작용 측정, 명령·데이터의 구조적 분리, 합의 샘플링, 다국어 안전 연구를 정리했다.
핵심 내용 읽기 →
딥시크가 어텐션과 피드포워드에 이어 트랜스포머의 세 번째 블록으로 제안한 Engram. 자주 쓰이는 다중 토큰 패턴을 해시 조회로 즉시 꺼내 쓰는 구조와 삽입 위치, 예산 배분 실험 결과를 함께 정리했다.
핵심 내용 읽기 →
사전학습 데이터에 담긴 AI 묘사가 모델 행동을 바꾸는지 실증한 연구다. 6.9B 모델을 처음부터 네 가지 조건으로 학습시켜, 오정렬 담론과 정렬 담론을 각각 1%씩 넣었을 때의 차이를 직접 비교했다.
핵심 내용 읽기 →