휴머노이드 로봇 학습의 데이터 피라미드: 실제 로봇·시뮬레이션·영상 생성 모델을 섞는 코트레이닝
엔비디아 GEAR 랩과 UT오스틴 연구실을 함께 이끄는 유커 주 교수가 CMU 세미나에서 휴머노이드를 데이터 문제로 규정하고, 실제 로봇 데이터의 한계와 시뮬레이션·영상 생성 모델로 학습 데이터를 불리는 코트레이닝 전략을 설명했다.
핵심 내용 읽기 →AI TOPIC
합성 데이터 관련 핵심 뉴스와 활용 인사이트 19편을 최신순으로 모았습니다.

엔비디아 GEAR 랩과 UT오스틴 연구실을 함께 이끄는 유커 주 교수가 CMU 세미나에서 휴머노이드를 데이터 문제로 규정하고, 실제 로봇 데이터의 한계와 시뮬레이션·영상 생성 모델로 학습 데이터를 불리는 코트레이닝 전략을 설명했다.
핵심 내용 읽기 →
스탠퍼드대 항공우주공학 교수 후안 알론소가 물리 AI를 설명한다. 12시간 걸리던 유체 시뮬레이션을 1초 이내로 줄이는 기술과 합성 데이터 비율, 인증 규제의 벽, 수소 항공기 도입 전망까지 차례로 정리했다.
핵심 내용 읽기 →
딥시크 V4 기술보고서는 60쪽인데 데이터 설명은 한 문단뿐이다. 대학 LLM 강의가 짚은 웹 크롤링과 저작권 문제, 필터링과 중복 제거, 합성 데이터 활용, 그리고 SFT가 실제로 하는 역할까지 차례로 정리했다.
핵심 내용 읽기 →
대학 LLM 강의의 마지막 회차가 최신 사후학습 기법을 정리한다. RLVR과 RLHF의 차이, 합성 데이터의 가능성과 모델 붕괴 위험, 온폴리시 증류와 다중 교사 방식까지 최근 공개 모델의 실제 학습 레시피로 짚는다.
핵심 내용 읽기 →
긴 영상에서 헤매는 비디오 AI를 개선한 연구를 소개한다. 부정확한 시각 도구를 음성 전사와 웹검색으로 보완하고, 합성 질문·답변 데이터와 보상 설계를 통해 영상 길이에 맞춰 추론량을 스스로 조절하도록 학습시킨 과정을 정리했다.
핵심 내용 읽기 →
MIT와 IBM 연구진이 만든 ChartNet은 차트 이미지와 그림 코드, 데이터 표, 요약을 함께 담은 100만 건 규모 합성 데이터셋이다. 작은 오픈소스 모델의 차트 이해 성능을 끌어올린 방식을 정리했다.
핵심 내용 읽기 →
카카오 AI 엔지니어링팀이 if(kakao)25에서 공개한 롱컨텍스트 적용기. 위치 임베딩을 다시 맞추는 학습 없는 보정 기법부터 짧은 문서를 이어 붙여 장문 데이터를 합성하는 학습 전략, 링 어텐션과 데이터 패킹 최적화까지 짚었다.
핵심 내용 읽기 →
인터넷이 AI가 쓴 글로 채워지면 다음 세대 AI는 무엇을 배우게 될까. 머신러닝 연구자가 논문 열두 편을 훑어 '모델 붕괴'의 정의와 학습 가정이 갈리는 지점을 정리하고, 자기 출력으로 학습한 모델이 무엇을 잃는지와 붕괴를 피할 조건을 짚었다.
핵심 내용 읽기 →
인터넷이 AI 생성 데이터로 뒤덮이면 다음 세대 모델은 정말 망가질까. 최대우도추정이라는 고전적 틀로 모델 붕괴가 일어나는 조건과 일어나지 않는 조건을 가른 학계 강연을 정리했다. 데이터 대체와 누적의 차이, 그리고 경사 기반 학습이 실패하는 이유까지 함께 다룬다.
핵심 내용 읽기 →
AI가 만든 데이터로 다시 AI를 학습시키면 희귀한 지식부터 사라지는 '모델 붕괴'가 나타난다. IBM 해설 영상을 바탕으로 붕괴가 진행되는 두 단계, 이미 벌어지고 있는지에 대한 논쟁, 그리고 사람 데이터 주입·출처 추적·RAG 같은 대응책을 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS329A '자기개선 AI 에이전트' 마지막 강의가 남은 연구 과제를 짚었다. 추론 사슬의 다양성, 검증의 병목, 학습 과제 선택이라는 세 병목과 와트당 지능이라는 효율 지표를 정리한다.
핵심 내용 읽기 →
GPU 가격이 반등하고 추론 토큰 사용량이 급증하는 상황에서, 학습 데이터를 정제하고 선별하는 것만으로 같은 예산에 훨씬 좋은 모델을 얻는 방법을 데이톨로지AI 최고경영자의 콘퍼런스 발표 내용을 바탕으로 정리했습니다.
핵심 내용 읽기 →
아씨 AI 사전학습 총괄 바룬 싱은 웹 텍스트를 그대로 반영하던 베이스 모델의 시대가 끝났다고 말한다. 사후학습 데이터가 사전학습으로 앞당겨지고, 사전학습은 강화학습을 위한 준비 단계로 재정의되고 있다.
핵심 내용 읽기 →
엔비디아가 GTC 타이베이에서 코스모스 3을 공개했다. 텍스트·이미지·영상·행동을 아우르는 다섯 양식을 입력과 출력 양쪽에서 처리하며, 예전에는 여러 모델을 이어 붙여야 했던 일을 하나의 모델로 접었다.
핵심 내용 읽기 →
구글 딥마인드의 알파지오메트리는 IMO 기하 30문제 중 25문제를 풀었다. 그런데 그 성과의 상당 부분은 AI가 아니라 2000년에 나온 규칙 기반 추론기의 몫이었다. 언어 모델이 맡은 역할과 합성 데이터 생성 방식을 함께 짚었다.
핵심 내용 읽기 →
AI 코딩 모델을 만드는 poolside 팀이 오픈 웨이트 모델을 키우며 겪은 합성 데이터 설계와 대규모 학습의 무결성 문제, 그리고 그 해결책을 정리했다.
핵심 내용 읽기 →
1억 3500만 파라미터 모델을 내 문서 전용 일꾼으로 바꾸는 전 과정을 따라간다. 로컬 모델과 제약 디코딩으로 합성 데이터를 만들고, 학습과 평가를 거쳐 하네스로 감싸 실제 서비스에 쓰는 방법까지 정리했다.
핵심 내용 읽기 →
다른 모델의 출력을 베껴 쓰는 증류를 사전학습에서 거부하고 사람이 만든 데이터만으로 추론 모델을 만들었다는 마이크로소프트 기술 보고서를, 데이터 선별 기준과 실제로 치른 학습 비용, 그리고 성적표까지 함께 짚어 본다.
핵심 내용 읽기 →
합성 데이터는 실제 사건이 아니라 컴퓨터가 만들어 낸 데이터다. AI 학습·민감정보 보호·편향 완화 같은 쓸모와 한계, GAN 등 생성 방법을 쉽게 정리했다.
핵심 내용 읽기 →