언어모델 세계 모형 검증: MIT 선형 탐침 실험이 밝혀낸 내부 상태 표현과 그 한계
MIT 제이컵 안드레아스가 언어모델이 글 속 상황의 상태를 내부에 표현하는지 선형 탐침으로 검증한 강연을 정리했다. 상태 복원 정확도와 표현 편집 실험, 그리고 공간 추론에서 드러난 한계를 함께 짚는다.
핵심 내용 읽기 →AI TOPIC
AI 연구 관련 핵심 뉴스와 활용 인사이트 86편을 최신순으로 모았습니다.

MIT 제이컵 안드레아스가 언어모델이 글 속 상황의 상태를 내부에 표현하는지 선형 탐침으로 검증한 강연을 정리했다. 상태 복원 정확도와 표현 편집 실험, 그리고 공간 추론에서 드러난 한계를 함께 짚는다.
핵심 내용 읽기 →
2024년 튜링상을 받은 리치 서튼이 강화학습이 어떻게 시작됐는지, 시간차 학습의 착상은 어디서 왔는지, 딥러닝이 아직 풀지 못한 표현 학습 문제가 무엇인지를 톰 미첼과의 대담에서 차례로 짚어 나간다.
핵심 내용 읽기 →
AI가 90년 가까이 풀리지 않던 야코비안 추측의 3차원 반례를 찾아냈다. 수학자가 자판기 비유로 풀어주는 반례의 의미와 여전히 남아 있는 2차원 문제, 그리고 이 결과의 저자는 누구인가라는 질문까지 정리했다.
핵심 내용 읽기 →
인기 객관식 벤치마크는 문제를 통째로 가려도 절반 넘게 맞힐 수 있다. AI 평가를 연구하는 발표자가 보기를 없앤 정답 대조 채점과 과제 길이 측정으로 평가 체계를 다시 짜야 한다고 말한 근거와 실험 결과를 정리했다.
핵심 내용 읽기 →
엔비디아 GEAR 랩과 UT오스틴 연구실을 함께 이끄는 유커 주 교수가 CMU 세미나에서 휴머노이드를 데이터 문제로 규정하고, 실제 로봇 데이터의 한계와 시뮬레이션·영상 생성 모델로 학습 데이터를 불리는 코트레이닝 전략을 설명했다.
핵심 내용 읽기 →
로스쿨 시험 340개에서 뽑은 문항으로 대형 언어 모델 26개를 평가한 LEXam 연구 발표를 정리했다. 오답 보기를 늘리기만 해도 정확도가 절반으로 떨어졌고, 추론 시간을 늘려도 성능은 나아지지 않았다.
핵심 내용 읽기 →
MIT 알렉스 장이 제안한 재귀 언어모델(RLM)은 긴 프롬프트를 모델에 직접 넣는 대신 파이썬 실행 환경에 저장해 두고, 모델이 코드로 훑어보며 자기 자신을 부분 호출해 답을 만든다. 서브에이전트 도구 호출과 무엇이 다른지 정리했다.
핵심 내용 읽기 →
정답 여부만 보상으로 주는 학습에서 기존 강화학습은 로그가 빠진 1차 근사식을 최적화한다. 성공한 롤아웃 개수로 나누는 한 줄 변경만으로 최대우도에 접근하는 MaxRL의 논리와 네 갈래 실험 결과, 그리고 그 한계를 정리했다.
핵심 내용 읽기 →
예시나 프롬프트만으로는 사람의 의도가 제대로 전달되지 않는다. MIT 제이컵 안드레아스 교수가 카네기멜런대 로보틱스 세미나에서 소개한, 언어 모델이 스스로 좋은 질문을 던지게 만드는 연구들을 정리했다.
핵심 내용 읽기 →
코그니전트 AI 랩 연구진이 수십억 파라미터 언어 모델을 역전파 없이 미세조정한 실험을 공개했다. 가중치에 잡음을 더한 모델 30개만 비교해도 강화학습에 맞먹는 성능이 나왔고, 시드와 하이퍼파라미터를 바꿔도 결과 편차가 훨씬 작았다는 점이 핵심이다.
핵심 내용 읽기 →
MIT 레슬리 켈블링 교수가 CMU 로보틱스 연구소 세미나에서 데이터로만 배우는 로봇의 한계를 짚고, 믿음과 세계 모델을 갖춘 로봇이 시연 세 번만 보고 시연자의 의도를 추론해 새로운 장면에서 작업을 해내는 연구 결과를 소개했다.
핵심 내용 읽기 →
앨런AI연구소 연구진이 GRE·SAT 같은 시험이 쓰는 문항반응이론을 LLM 벤치마크에 적용했다. 모델 실력에 맞춰 문항을 골라 가는 유동적 벤치마킹은 50문항만으로 무작위 500문항보다 나은 평가 품질을 냈다고 한다.
핵심 내용 읽기 →
UC 버클리 앨리슨 고프닉이 아이의 능동적 탐색을 설명하는 임파워먼트 개념을 소개했다. 행동과 결과의 연결을 최대화하는 보상이 인과 지식을 만들고, 대규모 모델이 약한 지점도 함께 드러난다는 주장이다.
핵심 내용 읽기 →
인지과학자 제니퍼 후는 인간 언어 연구가 통제 실험도 동물 모델도 쓸 수 없다는 한계에서 출발해, 언어 모델을 실험 대상으로 삼아 연관 학습만으로 어디까지 배울 수 있는지 확인하는 연구를 소개한다.
핵심 내용 읽기 →
MIT 레슬리 케일블링 교수가 UC버클리 EMBER 세미나에서 밝힌 로봇 지능 설계론. 정책을 통째로 학습하는 대신 희소하고 객체 중심적인 세계 모델을 만들어 실행 시점에 계획하게 하면 시연 몇 번으로도 일반화된다는 주장이다.
핵심 내용 읽기 →
백악관 과학기술정책실이 공개한 '과학의 새로운 황금시대' 보고서와 제네시스 미션이 연구비 심사 방식, 자율 실험실, 국가 단위 과학 데이터 인프라를 어떻게 다시 설계하려 하는지, AI 시대 과학자의 역할은 어떻게 달라지는지 정리했습니다.
핵심 내용 읽기 →
AI가 사람이 검토할 수 있는 속도보다 빠르게 코드를 쏟아내는 상황에서, 텍사스대 오스틴 연구진이 파라미터를 고정한 LLM의 은닉 상태만으로 품질 점수를 매기는 경량 회귀 기법 RELISH를 제안했다. 학습과 추론 비용도 함께 낮췄다.
핵심 내용 읽기 →
뉴욕대 그레그 더렛 교수가 연구소 세미나에서 발표한 LLM 추론 강연을 정리했다. 사고 사슬이 수학에서만 잘 듣는 이유, 강화학습이 기존 행동만 증폭한다는 관찰, 에이전트가 자기 불확실성을 다루는 방법을 다룬다.
핵심 내용 읽기 →
언어로만 생각하던 모델이 추론 도중 이미지를 만들어 낼 때 어떤 과제에서 실제로 나아지는지 통제 실험으로 확인한 칭화대 연구 발표를 정리했다. 종이접기와 공간 추론에서는 통했지만 단순 미로에서는 통하지 않은 이유를 짚는다.
핵심 내용 읽기 →
펜실베이니아대 AI 세미나에서 르네 비달 교수가 발표한 특징 학습 이론을 정리했다. 뉴런이 먼저 정렬되고 나중에 수렴하는 두 단계, ReLU의 지수를 바꿔 적대적 공격 취약성을 없애는 방법을 다룬다.
핵심 내용 읽기 →
굿파이어 연구자가 스탠퍼드 강의에서 언어 모델 내부에 반복해 나타나는 계산 패턴을 설명했다. 서로 무관해 보이는 두 과제가 같은 회로를 78퍼센트가량 공유한다는 실험과, 목록 중간을 놓치는 오류의 기하학적 설명까지 정리한다.
핵심 내용 읽기 →
언어모델을 여러 번 샘플링해 답을 고르는 방식이 표준이 되면서, 학습 중 보는 크로스 엔트로피만으로는 실제 성능을 예측하기 어려워졌다. 카네기멜런대 세미나에서 제시된 '커버리지' 개념과 실험 결과를 정리했다.
핵심 내용 읽기 →
UC 버클리와 xAI 소속 연구자가 발표한 생성형 AI 세미나 내용을 정리한다. 데이터 고갈에 대비한 데이터 재사용·엔드투엔드·분산 협업 전략과, 장기 계획·그라운딩·비용에서 드러난 AI 에이전트의 한계를 짚는다.
핵심 내용 읽기 →
워싱턴대·Ai2의 디터 폭스가 ETH 취리히 강연에서 로봇 학습의 병목은 모델이 아니라 데이터라고 짚었다. 시연으로 배운 로봇의 한계와, 시뮬레이션으로 조작 능력을 넓히는 '파운데이션 월드' 구상을 정리했다.
핵심 내용 읽기 →
챗봇을 오래 쓴 사람일수록 외로웠다는 헤드라인의 근거는 무작위 배정이 아니라 관찰 자료였다. 세 편의 연구를 나란히 놓고 무엇이 확인됐고 무엇은 아직 말할 수 없는지, 위험이 어디에 몰려 있는지 짚었다.
핵심 내용 읽기 →
마이크로소프트 연구진이 제안한 에너지 기반 미세조정(EBFT)은 다음 토큰 예측과 강화학습의 중간 지점을 노린다. 별도의 보상 모델이나 외부 검증기 없이 응답 전체를 특징 공간에서 맞춰 SFT보다 나은 결과를 냈다.
핵심 내용 읽기 →
MIT와 하버드 연구진이 강화학습 에이전트를 잡음 없는 환경에서 훈련하면 잡음 있는 환경에서 오히려 더 잘한다는 실험 결과를 내놨다. 알고리즘은 그대로 두고 학습 환경만 바꿔 성능을 끌어올린 사례다.
핵심 내용 읽기 →
AI 연구자 사라 후커가 프런티어 모델을 대규모로 훈련할 줄 아는 사람이 전 세계에 5천 명 남짓이라고 말하며, 사전학습 규모 확대의 수익이 꺾인 지금 누가 최전선 AI를 만들 수 있는지가 달라지고 있다고 설명했다.
핵심 내용 읽기 →
스탠퍼드 MLSys 세미나에서 엘루더AI의 스텔라 비더먼이 트랜스포머 내부를 역설계하는 회로 기법과 학습 동역학 관찰, 로짓 렌즈의 한계와 이를 보완한 튜닝 렌즈 연구까지 기계론적 해석 가능성 연구의 흐름을 짚었다.
핵심 내용 읽기 →
브라운대 엘리 파블릭 교수의 NYU 강연 정리. 언어모델 내부에는 재사용되는 회로와 방향 벡터 같은 뚜렷한 구조가 있지만, 동시에 같은 문제도 상황에 따라 다른 방식으로 푸는 맥락 의존성이 공존한다.
핵심 내용 읽기 →
ETH 취리히 로봇 학습 강의 9강 정리. 하나의 모델로 여러 로봇을 제어하는 제너럴리스트 로봇 정책이 데이터 수집, 이종 데이터 모델링, 평가 비용이라는 세 관문을 어떻게 넘고 있는지 Octo와 최신 VLA 학습법을 통해 살펴본다.
핵심 내용 읽기 →
2026년 스탠퍼드 물리·AI 학회에서 공개된 매드이볼브는 대형언어모델을 써서 우주론 알고리즘 코드를 세대마다 반복 개량한다. 세대당 30센트 미만 비용으로 성능을 끌어올렸지만, 좋은 출발 알고리즘을 고르는 일은 여전히 사람 몫이었다.
핵심 내용 읽기 →
와이콤비네이터 행사에서 소개된 테스트 타임 A* 탐색 연구 정리. 대형 교사 모델이나 외부 보상 모델 없이 모델 자신의 자기비평 점수를 휴리스틱으로 써서 소형 모델의 수학 추론 정확도를 끌어올린 방법이다.
핵심 내용 읽기 →
웹 에이전트 평가는 보통 과제 성공 여부만 본다. 카네기멜런대 연구자는 계획 능력을 시간 순서 판단·미래 상태 예측·행동 선택으로 쪼갠 뒤 기존 데이터셋을 재활용해 값싸게 채점하는 방법을 제시했다.
핵심 내용 읽기 →
리 샤키가 활성값 대신 파라미터 자체를 분해하는 APD 방법론을 설명한다. 충실성·최소성·단순성이라는 세 조건과 자동차 비유, 중첩·압축 계산 실험, 그리고 하이퍼파라미터 민감성이라는 한계까지 짚는다.
핵심 내용 읽기 →
AI 안전 연구자 오와인 에번스가 언어모델의 내성 능력과 학습된 성향의 자기 서술, 그리고 취약한 코드 6천 건만 학습시켰는데 전혀 무관한 질문에서도 악성 응답이 쏟아진 창발적 오정렬 실험을 차례로 설명한다.
핵심 내용 읽기 →
기계적 해석가능성 연구자 닐 난다가 멘토십 프로그램 참가자들에게 한 강연이다. 가치 정렬 대신 의도 정렬을, 정렬 증명 대신 오정렬 증명을 택하는 이유와 연구 주제를 고르는 두 가지 기준을 자세히 설명한다.
핵심 내용 읽기 →
모델이 커진 게 아니라 성격이 바뀌었다. 추론 모델과 에이전트 시대에 기계적 해석가능성 연구가 무엇을 해야 하는지, 통제보다 이해를 우선하라는 근거는 무엇인지, 닐 난다가 연구 장학생들에게 한 강연의 논지를 정리했다.
핵심 내용 읽기 →
펜실베이니아대 나탈리 콜리나가 TTIC 강연에서 인간과 AI가 예측을 주고받으며 합의에 이르는 조건과, 서로 어긋난 이해관계를 가진 AI 기업들이 경쟁을 통해 사용자에게 이로운 결과를 낼 수 있는 조건을 설명했다.
핵심 내용 읽기 →
엔비디아 연구원이 TTIC 강연에서 파운데이션 모델로 범용 로봇의 뇌를 만드는 방법을 설명했다. 행동을 텍스트로 출력하고, 점군을 정투상 이미지로 바꾸고, 전문가 모델과 계층으로 결합하는 세 가지 접근을 소개한다.
핵심 내용 읽기 →
트랜스포머는 왜 어떤 과제는 잘 풀고 어떤 과제는 문자열이 길어지면 무너질까. 노터데임대 연구진이 세는 연산을 중심에 둔 형식 모델로 어텐션 레이어 깊이의 한계와 길이 일반화 조건을 증명해 낸 강연 내용을 정리했다.
핵심 내용 읽기 →
UC 버클리 박사과정 연구자가 TTIC 강연에서 대형 언어 모델의 일반화와 환각이 하나의 학습 메커니즘에서 나온다는 분석과, 추론을 텍스트 대신 잠재 공간으로 옮겨 훨씬 작은 모델로 탐색 문제를 푼 실험 결과를 함께 발표했다.
핵심 내용 읽기 →
구글 로보틱스 연구진이 버클리 강연에서 언어 모델을 로봇의 계획 수립에 쓰는 방법과, 로봇이 실제로 할 수 있는 일을 반영하는 어포던스 모델의 역할, 그리고 남은 과제와 실패 사례를 설명했다.
핵심 내용 읽기 →
구글과 마이크로소프트에서 다국어 AI를 연구하다 카네기멜런대 박사과정을 택한 연구자가, 모델을 제품에 올려 본 경험이 연구 질문의 기준을 어떻게 바꿨는지와 왜 폭넓은 탐색 대신 깊이를 택했는지 설명한다.
핵심 내용 읽기 →
질문이 한참 뒤에 도착하는 스트리밍 영상 이해에서 캡션을 정답이 아니라 관련 구간을 찾는 색인으로 쓰고, 실제 화면으로 임시 답변을 검증하는 구조를 제안한 수업 프로젝트 발표를 정리했다. 실험 결과와 발표팀이 밝힌 한계도 함께 담았다.
핵심 내용 읽기 →
서울대 DSBA 연구실 발표를 바탕으로 지식 그래프의 기본 단위인 트리플과 온톨로지의 역할, 수집부터 서빙까지의 구축 파이프라인, 그리고 기업 사례에서 반복적으로 확인되는 아이덴티티와 품질 관리 설계 원칙을 정리했다.
핵심 내용 읽기 →
앤스로픽 해석가능성 팀의 스탠퍼드 CS25 강연 정리. 희소 오토인코더로 찾아낸 특징과 인과 그래프를 통해, 대규모 언어 모델이 추상 개념을 사용하고 여러 계산을 병렬로 굴리며 여러 단어 앞을 내다보고 계획한다는 증거를 살펴본다.
핵심 내용 읽기 →
코넬대와 UC 버클리 연구진이 프리프린트 210만 편과 동료 심사 보고서 2만 8천 건을 분석한 사이언스 논문을 정리했다. AI를 쓴 연구자의 생산량은 생명과학에서 52.9% 늘었지만, 잘 쓴 글이 좋은 연구를 뜻하던 신호는 무너졌다.
핵심 내용 읽기 →
제미나이를 연구하는 스와룹 미슈라가 인스트럭션 튜닝이 나온 배경과 프롬프트 엔지니어링과의 차이를 설명한다. 인스트럭션 데이터 품질 기준, 개인화 에이전트와 자기개선 모델의 가능성, 연구자에게 필요한 태도까지 정리했다.
핵심 내용 읽기 →
그래프 어텐션 네트워크를 만든 딥마인드 연구자가 AGI를 아직 이르다고 보는 이유, 알고리즘처럼 일반화하는 신경망 연구, 신진 연구자를 위한 현실적인 조언을 풀어놓은 인터뷰를 정리했다.
핵심 내용 읽기 →
인터넷에서 모은 30초 분량 파쿠르 영상 19개만으로 가상 인간이 장애물 코스를 스스로 헤쳐 나가도록 훈련한 연구를 정리했다. 사람 동작을 흉내 내는 학습과 목표에 도달하는 학습을 동시에 시키는 구조, 긴 코스 성공률 40%라는 한계까지 짚는다.
핵심 내용 읽기 →
웹·수학·코드 학습 데이터를 어떤 비율로 섞느냐가 모델 성능을 좌우한다. OLMo 3 개발 과정에서 정리된 데이터 믹싱 설계 선택지와, 개발 도중 데이터가 바뀔 때 재계산 비용을 줄이는 방법을 함께 살펴본다.
핵심 내용 읽기 →
안드레이 카파시가 공개한 AutoResearch는 GPU 한 대로 이틀간 700번의 실험을 스스로 돌려 20개의 최적화를 찾아냈다. 재귀적 자기개선 루프가 실제로 작동하는 방식과, 보상 해킹처럼 조용히 망가지는 지점을 정리했다.
핵심 내용 읽기 →
딥러닝논문읽기모임이 다룬 AnyGrasp 리뷰 정리. 학습하지 않은 물체와 움직이는 물체까지 7자유도로 집어내는 구조, 무게중심 고려, 실험 결과와 한계를 짚는다.
핵심 내용 읽기 →
서울대 DSBA 연구실 세미나가 웹아레나와 OS월드 두 벤치마크를 정리했다. GPT-4의 성공률은 각각 14.41%와 12.24%로, 같은 과제를 수행한 사람의 78.24%와 72.36%에 크게 못 미쳤고 실패의 상당수는 클릭 정확도 문제였다.
핵심 내용 읽기 →
로봇 엔지니어 채널이 코스모스 폴리시, VPP, 드림VLA, V-JEPA 2 등 최근 연구 다섯 편을 묶어, 미래를 예측하는 월드 모델이 VLA의 액션 헤드를 보완하거나 장기적으로 대체할 수 있는지, 그리고 실시간 제어와 정밀도라는 벽은 무엇인지 짚었다.
핵심 내용 읽기 →
GLM-4.5와 Kimi K2가 2주 사이 쏟아지며 오픈모델의 표준이 중국 쪽으로 기울고 있다. 전 라마 추론 리드 로스 테일러는 인재 신화보다 자원 배분과 평가 설계가 모델 품질을 가른다고 말한다.
핵심 내용 읽기 →
낡은 사실을 담은 거대 언어 모델을 통째로 재학습하지 않고 고치는 지식 편집 연구를 정리했다. 멀티홉 추론까지 반영하는 MeLLo, PokeMQA, CHECK 세 방법론의 구조와 장단점을 비교한다.
핵심 내용 읽기 →
AI 영상 생성 기술로 운영체제 화면 자체를 만들어내는 '뉴럴 컴퓨터' 연구를 정리했다. 디퓨전 트랜스포머 구조와 커서 처리 방식, 상태 유지라는 근본 난제까지 무엇이 되고 무엇이 안 되는지 짚는다.
핵심 내용 읽기 →
연구팀이 최신 AI들을 온라인 창의성 테스트에 참여한 일반인 10만 명과 비교했다. AI는 사람의 평균을 통계적으로 넘어섰지만 가장 창의적인 사람들의 점수에는 닿지 못했고, 글쓰기에서도 사람과 다른 영역에 모였다.
핵심 내용 읽기 →
논문 재현 벤치마크와 생물학 가설 생성 실험을 놓고 두 사람이 나눈 대화를 정리했다. 모델이 아직 인간에게 못 미치는 지점, 그리고 신입이 사라지면 15년 뒤 전문가도 남지 않는다는 경고까지 짚는다.
핵심 내용 읽기 →
OpenAI가 학술 연구자 10만 명에게 프런티어 모델 무료 접근을 제공한다고 밝혔다. 영상에 등장한 물리학자와 생명과학 연구자들은 막힌 문제를 푼 비유, 10분 만에 나온 분석 결과 등 실제 경험을 전했다.
핵심 내용 읽기 →
스탠퍼드 온라인이 소개한 '불확실성 하의 의사결정' 강의 요약. 결과와 모형이 모두 불확실할 때 최적의 결정을 찾는 방법과 한계, 벨만이 지적한 차원의 저주, 그리고 AI 시스템의 실제 배포를 가로막는 검증 문제를 정리했다.
핵심 내용 읽기 →
LLM에게 다른 LLM의 답변을 채점하게 하는 방식은 얼마나 믿을 만할까. 22개 유형의 오류를 일부러 심어 평가자 모델을 시험한 FBI 프레임워크 연구 결과를 정리했다.
핵심 내용 읽기 →
코히어 최고 AI 책임자 조엘 피노가 AI 연구의 남은 숙제로 기억, 월드모델, 효율적 추론을 꼽았다. 기업 현장의 활용 격차와 AI 주권 논의까지 정리했다.
핵심 내용 읽기 →
중국 연구진이 AI 에이전트의 연구자 자질을 재는 새 벤치마크를 공개했다. 최고 조합도 가장 낮은 인턴 수준 과제에서 성공률 68.3%에 머물렀고, 기능이 많은 하네스보다 도구를 최소화한 쪽이 더 좋은 성적을 냈다.
핵심 내용 읽기 →
애리조나주립대 비벡 굽타 교수가 팟캐스트에서 밝힌 LLM의 추론 능력과 취약성, 스케일링의 한계, 학계와 산업계의 역할 분담, 그리고 대학원생을 위한 조언을 자막을 바탕으로 정리했다.
핵심 내용 읽기 →
서울대 DSBA 연구실 세미나가 공개 지식 그래프 다섯 곳의 품질 비교 논문과 구축 파이프라인 논문을 함께 짚었다. 클래스 규모보다 온톨로지 설계가 품질을 가른다는 분석과 증분 갱신 과제를 정리했다.
핵심 내용 읽기 →
구글 딥마인드의 아이다 네마트자데가 멀티모달 모델 평가를 이야기한다. 벤치마크가 정말 그 능력을 재는지 검증하는 연구가 빠져 있고, 모델이 모델을 채점하는 방식도 과제에 따라 신뢰도가 갈린다고 짚는다.
핵심 내용 읽기 →
기계적 해석 가능성을 연구하는 기업의 공동창업자가 직접 설명한다. 유전체 모델이 학습한 계통수 구조, 사고 사슬이 실제 계산을 반영하지 않는 문제, 모델이 스스로 환각을 잡아내게 만든 사례까지 짚는다.
핵심 내용 읽기 →
음성인식에 머신러닝을 도입한 리카이푸가 1980년대 CMU 시절부터 오늘의 대규모 언어모델까지를 돌아본다. 전문가 시스템과의 경쟁, 데이터와 컴퓨트의 힘, 그리고 후배 연구자를 위한 조언까지 정리했다.
핵심 내용 읽기 →
1970년대 스탠퍼드에서 만들어진 메타덴드랄은 기계학습이 찾아낸 지식이 화학 학술지에 실린 첫 사례였다. 철학에서 AI로 옮겨간 브루스 뷰캐넌이 데이터가 극도로 비쌌던 시절의 연구 방식과 그 교훈을 회고한다.
핵심 내용 읽기 →
FAR.AI 강연에서 심플렉스의 애덤 샤이가 다음 토큰 예측 학습이 트랜스포머 내부에 어떤 기하학적 믿음 구조를 만드는지 설명했다. 합성 데이터 실험에서 예측된 프랙탈 구조가 잔차 스트림에서 확인됐고, 표현이 직교 부분공간으로 분해되는 경향도 관찰됐다.
핵심 내용 읽기 →
딥시크가 제안한 엔그램은 연속된 토큰 조합을 해시로 색인해 임베딩 표에서 사실 지식을 직접 조회한다. 문맥 인지 게이팅으로 주입량을 조절하는 방식과 전문가 혼합 구조와의 역할 분담, 추론 성능까지 함께 오른 이유를 정리했다.
핵심 내용 읽기 →
버클리 박사과정 파스 아사와가 Snorkel AI 벤치토크에서 설명하는 지속 학습(Continual Learning). 모델이 학습을 멈춘 채 얼어붙는 문제, 상태 유지 vs 무상태 성능을 분리하는 gain 지표, 컨텍스트 관리와 파라미터 학습 접근의 차이를 다룹니다.
핵심 내용 읽기 →
한 개발자가 컨텍스트 창 대신 대화를 가중치에 새기는 실험을 소개한다. REM 수면에서 착안한 'AI 꿈' 생성으로 지속 학습을 흉내 내고, 그 한계와 안전 문제까지 짚는다.
핵심 내용 읽기 →
완전 공개 추론 모델 Olmo 3를 만든 연구자가 아키텍처 선택, 추론 중심 데이터, SFT·DPO·강화학습(RLVR) 파이프라인, 그리고 평가에서 겪은 어려움까지 프런티어 모델 제작 과정을 처음부터 끝까지 설명한다.
핵심 내용 읽기 →
에너지 기반 모델과 트랜스포머를 결합한 EBT는 토큰마다 계산량을 조절하고, 스스로 답의 확신도를 판단합니다. 학습·추론 방식과 한계를 정리했습니다.
핵심 내용 읽기 →
스탠퍼드 CS336 ‘바닥부터 만드는 언어 모델’ 1강 요약. 프롬프트만으로는 닿지 못하는 근본 이해, 효율성이 곧 성능이라는 관점, 그리고 언어 모델의 역사와 에이전트 시대까지의 흐름을 정리한다.
핵심 내용 읽기 →
딥시크가 2026년 첫 논문 'mHC(Manifold-Constrained Hyper-Connections)'를 공개했다. 2016년 이후 거의 그대로였던 잔차 연결을 확장하면서도 학습 안정성을 되살린 핵심 아이디어를 정리했다.
핵심 내용 읽기 →
코드 생성, 의료 진단, 과학 논문 분석과 자율 실험 등 에이전트 AI가 실제로 대체해 가는 업무들을 정리하고, 직원 없는 기업이라는 미래 전망까지 짚어본다.
핵심 내용 읽기 →
세일즈포스 AI 연구팀이 설명하는 멀티모달 AI. 여러 모달리티를 융합하는 이유, LLM에 번역 모듈을 붙여 이미지·소리를 이해시키는 구조, 교차모달 추론과 에이전트 활용까지 정리했다.
핵심 내용 읽기 →
한 AI 연구과학자가 통계 설계부터 코드 이해·테스트·시각화·논문 작성까지 LLM과 클로드 코드를 실제로 어떻게 쓰는지, 검증 원칙과 함께 정리했습니다.
핵심 내용 읽기 →
텍스트만 학습한 LLM이 물리 세계를 제대로 이해하지 못하는 이유와, 시뮬레이션으로 세상을 배우는 '월드 모델'의 구조·역사·최신 흐름을 쉽게 정리했다.
핵심 내용 읽기 →
여러 AI 에이전트가 문장 대신 디코딩하지 않은 숫자(잠재 상태)를 직접 주고받자 같은 연산으로 더 좋은 답을 얻었다는 연구를, 쉬운 비유로 풀어 소개한다.
핵심 내용 읽기 →
프롬프트 하나로 AI가 문헌 조사부터 실험 실행, 코드 작성, 논문 집필까지 끝내는 ‘바이브 리서치’ 플랫폼을 직접 시연한 영상을 정리했습니다. 작동 방식과 한계까지 살펴봅니다.
핵심 내용 읽기 →