언어모델 세계 모형 검증: MIT 선형 탐침 실험이 밝혀낸 내부 상태 표현과 그 한계
MIT 제이컵 안드레아스가 언어모델이 글 속 상황의 상태를 내부에 표현하는지 선형 탐침으로 검증한 강연을 정리했다. 상태 복원 정확도와 표현 편집 실험, 그리고 공간 추론에서 드러난 한계를 함께 짚는다.
핵심 내용 읽기 →AI TOPIC
언어 모델 관련 핵심 뉴스와 활용 인사이트 50편을 최신순으로 모았습니다.

MIT 제이컵 안드레아스가 언어모델이 글 속 상황의 상태를 내부에 표현하는지 선형 탐침으로 검증한 강연을 정리했다. 상태 복원 정확도와 표현 편집 실험, 그리고 공간 추론에서 드러난 한계를 함께 짚는다.
핵심 내용 읽기 →
CMU 고급 자연어 처리 강의가 짚은 다국어 NLP의 현실을 정리했다. 언어별 데이터 격차와 형태론 문제, 다국어성의 저주와 토크나이저 불균형, 번역 모델과 평가 지표, 전이 학습과 능동 학습 전략까지 살펴본다.
핵심 내용 읽기 →
앤트로픽 연구원 니콜라스 칼리니가 보안 컨퍼런스에서 언어모델이 사람 도움 없이 리눅스 커널과 오픈소스 CMS의 실제 취약점을 찾아 익스플로잇까지 만들어낸 사례를 공개하고, 방어자에게 남은 시간이 짧다고 경고했다.
핵심 내용 읽기 →
2천 년을 이어온 대조법이 챗GPT 확산 2년 만에 AI가 쓴 글의 표식으로 전락했다. RLHF 보상 모델이 이 문체를 선호하도록 학습된 구조와, AI 업계 내부에서 터져 나온 슬롭 피로감을 함께 정리했다.
핵심 내용 읽기 →
예시나 프롬프트만으로는 사람의 의도가 제대로 전달되지 않는다. MIT 제이컵 안드레아스 교수가 카네기멜런대 로보틱스 세미나에서 소개한, 언어 모델이 스스로 좋은 질문을 던지게 만드는 연구들을 정리했다.
핵심 내용 읽기 →
사전학습 언어모델은 문맥은 잘 배우지만 개별 사실을 안정적으로 기억하지 못한다. 서울대 DSBA 연구실 스터디를 토대로 ERNIE와 KnowBERT가 지식 그래프를 언어모델에 주입한 방식과 그 한계를 정리했다.
핵심 내용 읽기 →
인지과학자 제니퍼 후는 인간 언어 연구가 통제 실험도 동물 모델도 쓸 수 없다는 한계에서 출발해, 언어 모델을 실험 대상으로 삼아 연관 학습만으로 어디까지 배울 수 있는지 확인하는 연구를 소개한다.
핵심 내용 읽기 →
AI 안전 연구자 제이컵 헤임스가 공개 벤치마크와 통계적으로 구별되지 않는 문제집을 사후에 만들어, 최신 언어모델의 시험 점수가 학습 데이터 오염으로 얼마나 부풀려졌는지 재는 방법과 결과를 설명했다.
핵심 내용 읽기 →
스탠퍼드 CS336 첫 강의는 프런티어 모델을 직접 만들 수 없는 시대에도 왜 밑바닥 구현이 필요한지 설명한다. 효율성이라는 하나의 기준, 작은 규모 실험의 함정, 문자·바이트·단어 방식을 거쳐 BPE 토크나이저에 이르는 과정을 정리했다.
핵심 내용 읽기 →
MIT 박사과정 연구자가 MERL 세미나에서 발표한 형식 수학 연구를 정리했다. 린 데이터를 뽑아내는 린도조부터, 사람 시범 없이 4천 줄짜리 AI 증명을 절반으로 줄인 증명 최적화 모델까지 다룬다.
핵심 내용 읽기 →
AI 세이프티 폴란드 세미나에서 공개된 비밀 지식 추출 벤치마크를 정리했다. 일부러 비밀을 심은 모델 세 종을 만들어 프리필 공격과 해석가능성 기법이 얼마나 비밀을 캐내는지 겨루게 한 실험과 그 한계를 다룬다.
핵심 내용 읽기 →
안전하지 않은 코드로 미세조정한 모델이 코드와 무관한 영역에서까지 무너진다. 그런 모델에게 직접 물으면 스스로 낮은 점수를 매기는 현상과, 그 자기인식을 벡터로 조종해 본 폴란드 AI 안전 세미나 발표를 정리했다.
핵심 내용 읽기 →
굿파이어 연구자가 스탠퍼드 강의에서 언어 모델 내부에 반복해 나타나는 계산 패턴을 설명했다. 서로 무관해 보이는 두 과제가 같은 회로를 78퍼센트가량 공유한다는 실험과, 목록 중간을 놓치는 오류의 기하학적 설명까지 정리한다.
핵심 내용 읽기 →
언어모델을 여러 번 샘플링해 답을 고르는 방식이 표준이 되면서, 학습 중 보는 크로스 엔트로피만으로는 실제 성능을 예측하기 어려워졌다. 카네기멜런대 세미나에서 제시된 '커버리지' 개념과 실험 결과를 정리했다.
핵심 내용 읽기 →
ACL 2024 최우수 논문 '미션 임파서블 언어 모델'은 사람이 배울 수 없는 인공 언어를 여러 단계로 만들어 GPT-2를 처음부터 학습시켰고, 언어가 불가능해질수록 학습이 어려워진다는 결과로 촘스키의 주장을 반박했다.
핵심 내용 읽기 →
CMU 고급 자연어처리 강의가 다룬 강화학습 기초를 정리했다. 지도 미세조정의 세 가지 한계, 마르코프 결정 과정과 정책 경사, 할인과 베이스라인, PPO의 클리핑까지 언어 모델 학습의 뼈대를 짚는다.
핵심 내용 읽기 →
트랜스포머의 모든 행렬 곱셈을 -1·0·1 세 값의 3진 연산으로 바꾼 논문을 해설한다. 어텐션을 선형 순환 구조로 교체한 이유와 스케일링 곡선 교차점 주장, 그리고 전용 하드웨어가 필요한 한계를 짚는다.
핵심 내용 읽기 →
구글 딥마인드와 UC 버클리가 쓴 테스트 타임 컴퓨팅 논문을 야닉 킬처가 뜯어봤다. 추론 단계에 연산을 더 쓰는 방법들을 비교하고, 사전학습 확대와 어느 쪽이 유리한지, 저자들의 일반화 주장이 어디까지 믿을 만한지 짚는다.
핵심 내용 읽기 →
MIT 필립 아이솔라 교수가 ICML 포지션 논문 '플라토닉 표상 가설'을 강연으로 풀어냈다. 구조도 데이터도 서로 다른 신경망들이 왜 닮은 내부 표상을 학습하는지, 비전과 언어를 넘나드는 실험 증거와 이 가설이 부딪히는 한계를 함께 정리했다.
핵심 내용 읽기 →
서울대 DSBA 연구실 온톨로지·지식 그래프 스터디 20회차가 K-BERT와 KEPLER를 나란히 놓고, 지식을 문장에 직접 삽입하는 방식과 사전 학습 목적 함수로 녹여 넣는 방식의 차이를 실험 결과와 함께 정리했다.
핵심 내용 읽기 →
스탠퍼드 MLSys 세미나에서 엘루더AI의 스텔라 비더먼이 트랜스포머 내부를 역설계하는 회로 기법과 학습 동역학 관찰, 로짓 렌즈의 한계와 이를 보완한 튜닝 렌즈 연구까지 기계론적 해석 가능성 연구의 흐름을 짚었다.
핵심 내용 읽기 →
브라운대 엘리 파블릭 교수의 NYU 강연 정리. 언어모델 내부에는 재사용되는 회로와 방향 벡터 같은 뚜렷한 구조가 있지만, 동시에 같은 문제도 상황에 따라 다른 방식으로 푸는 맥락 의존성이 공존한다.
핵심 내용 읽기 →
언어모델 내부를 들여다보는 해석가능성 연구가 지금까지 무엇을 밝혀냈고 어떤 비판을 받아 왔는지, 그리고 18만여 편 규모의 인용 그래프와 연구자 설문으로 그 영향력을 실제로 측정한 결과는 무엇이었는지 정리했다.
핵심 내용 읽기 →
딥마인드 연구자가 스탠퍼드 물리학·AI 학회에서 발표한 'AI의 물리학' 강연 정리. 단어 동시출현 통계에 숨은 속성의 독립성과 병진 대칭이 언어모델 내부 표현의 선형성과 감기는 기하를 만든다고 설명한다.
핵심 내용 읽기 →
서울대학교AI연구원 선도혁신연구센터 킥오프 발표 정리. 점수 위주로 파편화된 기존 환자 보고 결과 설문의 한계를 짚고, 대화형 언어모델로 환자의 서사를 담는 플랫폼을 만들려는 연구 계획을 소개한다.
핵심 내용 읽기 →
지금의 대형 언어모델은 앞에서부터 한 단어씩 이어 쓰는 자기회귀 방식이다. LLaDA는 이미지 생성에 쓰이던 확산 모델을 언어로 옮겨, 가려 둔 토큰을 여러 번에 걸쳐 벗겨 내며 문장을 완성하는 대안을 제시한다.
핵심 내용 읽기 →
닐 난다가 Gemma 2 2B와 9B의 토큰별 KL 발산을 비교하며 두 모델이 갈리는 지점을 찾는 과정을 실시간으로 공개했다. 탐색 단계 연구에서 무엇을 노려야 하는지, 코딩을 모델에 맡기는 방식의 득실은 무엇인지가 함께 드러난다.
핵심 내용 읽기 →
AI 안전 연구자 오와인 에번스가 언어모델의 내성 능력과 학습된 성향의 자기 서술, 그리고 취약한 코드 6천 건만 학습시켰는데 전혀 무관한 질문에서도 악성 응답이 쏟아진 창발적 오정렬 실험을 차례로 설명한다.
핵심 내용 읽기 →
MIT 박사과정 연구자가 TTIC 강연에서 언어 모델의 긴 추론이 오류를 누적하는 '지평의 저주'를 설명하고, 되돌아가기를 허용한 무작위 걸음 알고리즘으로 이를 완화하는 이론적 보장과 실험 결과를 제시했다.
핵심 내용 읽기 →
구글 로보틱스 연구진이 버클리 강연에서 언어 모델을 로봇의 계획 수립에 쓰는 방법과, 로봇이 실제로 할 수 있는 일을 반영하는 어포던스 모델의 역할, 그리고 남은 과제와 실패 사례를 설명했다.
핵심 내용 읽기 →
안드레이 카파시가 makemore 5편에서 다층 퍼셉트론을 웨이브넷식 계층 구조로 바꾸고 문맥을 8자로 늘린 뒤 배치 정규화 버그까지 잡아 검증 손실을 2.10에서 1.993으로 낮추는 과정을 정리했다.
핵심 내용 읽기 →
안드레이 카파시가 벤지오의 2003년 논문을 따라 다층 퍼셉트론 언어 모델을 직접 구현한다. 임베딩 테이블부터 미니배치, 학습률 탐색, 학습·검증·테스트 분할까지 딥러닝의 기본기를 코드로 하나씩 짚어간다.
핵심 내용 읽기 →
안드레이 카파시가 이름 3만 2천 개로 문자 단위 바이그램 언어모델을 밑바닥부터 만든다. 빈도를 세어 표를 만드는 방법과 신경망을 경사하강으로 학습시키는 방법이 왜 똑같은 결과에 도달하는지, 그리고 트랜스포머로 이어지는 뼈대가 무엇인지 짚어본다.
핵심 내용 읽기 →
언어 모델이 사진과 영상, 소리를 이해하게 된 과정을 비전 트랜스포머와 CLIP, 플라밍고와 Q-Former, 오디오 모델까지 따라가며 모달리티마다 반복되는 세 단계 설계로 정리했다.
핵심 내용 읽기 →
1970년대 무시당했던 역전파가 오늘날 모든 AI 모델의 학습을 떠받친다. 도시 세 곳을 맞히는 초소형 모델로 손실, 소프트맥스, 연쇄법칙, 경사하강을 따라간다.
핵심 내용 읽기 →
독수리를 좋아하도록 유도한 교사 모델이 만든 숫자 나열만으로 학생 모델을 학습시켰더니 학생도 독수리를 좋아하게 됐다. 2025년 보고된 잠재 학습 현상과 그 수학적 설명, 그리고 AI 안전에 남긴 숙제를 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS224N 강의가 ChatGPT 같은 챗봇의 훈련을 세 단계로 설명한다. 제로샷·퓨샷과 사고 사슬 프롬프팅, 명령 파인튜닝, 그리고 인간 피드백 기반 강화학습(RLHF)과 보상 모델까지 정리했다.
핵심 내용 읽기 →
트랜스포머 어텐션이 각 토큰 자신의 값 벡터에 치우치는 '어텐션 유사도 편향'을 짚고, 직교 투영으로 그 성분을 제거해 맥락 정보에만 집중하게 하는 XSA 기법을 코드 두 줄과 모델 실험 결과로 함께 설명한다.
핵심 내용 읽기 →
셀프 어텐션은 문장을 순서 없는 단어 묶음으로 읽는다. 사인파 위치 인코딩의 한계와, 최신 언어 모델이 RoPE로 상대 위치를 회전으로 담는 원리를 쉽게 설명한다.
핵심 내용 읽기 →
3Blue1Brown이 gzip 압축만으로 언어 계통을 찾아낸 2002년 연구에서 출발해, 크로스 엔트로피가 무엇이며 왜 대규모 언어 모델의 학습 손실함수로 쓰이는지를 직관적으로 설명하고, 압축과 학습 사이의 숨은 연결까지 짚어 본다.
핵심 내용 읽기 →
구·다오가 제안한 상태공간모델(SSM)과 맘바는 RNN과 CNN의 장점을 결합해 언어모델을 효율적으로 바꾸고 있다. 경주용 자동차 비유로 상태·입력·출력과 네 개의 행렬, 그리고 합성곱으로 빨라지는 원리를 풀어낸다.
핵심 내용 읽기 →
메타 연구진의 프리 트랜스포머는 디코더 트랜스포머에 잠재 변수를 더해 좋은 리뷰냐 나쁜 리뷰냐 같은 큰 결정을 먼저 내린다. 변분 오토인코더(VAE)를 트랜스포머 중간에 끼워 넣은 이 구조와 정보량 제한이라는 핵심 균형을 해설한다.
핵심 내용 읽기 →
허깅페이스 강연이 인간 피드백 강화학습(RLHF)을 처음부터 설명한다. 언어모델 사전학습, 보상모델 학습, PPO 기반 강화학습 미세조정의 3단계를 정리한다.
핵심 내용 읽기 →
앤트로픽이 언어 모델 내부에 스스로 생겨난 '작업공간'을 발견했다. 클로드가 겉으로 내놓지 않는 진짜 생각이 여기 담기며, 이를 편집하면 답이 바뀐다. AI 정렬 연구에 주는 의미를 정리했다.
핵심 내용 읽기 →
언어 모델은 호출할 때마다 사실상 상태가 없다. 인지과학의 네 가지 기억인 작업·일화·의미·절차 기억을 RAG 기반 에이전트로 구현해, 무상태 언어 모델에 지속적 맥락과 학습 능력을 부여하는 방법을 단계별로 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS336 ‘바닥부터 만드는 언어 모델’ 1강 요약. 프롬프트만으로는 닿지 못하는 근본 이해, 효율성이 곧 성능이라는 관점, 그리고 언어 모델의 역사와 에이전트 시대까지의 흐름을 정리한다.
핵심 내용 읽기 →
안드레이 카파시의 GPT 직접 만들기 강의 전반부에 나오는 바이그램 언어 모델을 셰익스피어 데이터 예제로 풀어, 토큰·임베딩 표·손실·소프트맥스 개념을 정리한다.
핵심 내용 읽기 →
사람이 답변에 순위를 매기고, 그 점수를 강화학습으로 학습시켜 언어모델을 다듬는 RLHF. 가치 신경망과 정책 신경망이 무엇을 흉내 내는지 그리드 게임 비유로 풀어본다.
핵심 내용 읽기 →
프롬프트 엔지니어링이 왜 고연봉 직업으로 떠올랐을까. 코딩 지식 없이도 AI와 언어 모델의 기본, 좋은 프롬프트 작성법, 제로샷·퓨샷, 환각, 텍스트 임베딩까지 입문자가 알아야 할 핵심을 정리했다.
핵심 내용 읽기 →
에든버러대 미렐라 라파타 교수의 영국 왕립연구소 튜링 강연. 생성형 AI가 새 개념이 아닌 이유, 언어 모델과 트랜스포머의 원리, 그리고 편향·환각·에너지 같은 위험을 일반 독자 눈높이로 정리했다.
핵심 내용 읽기 →