PyTorch Dataset·DataLoader 최적화 — CMU 딥러닝 수업이 짚은 데이터 병목 진단과 여덟 가지 처방
학습이 느린 진짜 원인은 GPU가 아니라 데이터 파이프라인인 경우가 많다. 카네기멜런대 딥러닝 수업 실습에서 짚은 Dataset과 DataLoader의 역할 분담, 병목을 재는 방법, 속도를 끌어올리는 여덟 가지 기법을 정리했다.
핵심 내용 읽기 →AI TOPIC
데이터 파이프라인 관련 핵심 뉴스와 활용 인사이트 12편을 최신순으로 모았습니다.

학습이 느린 진짜 원인은 GPU가 아니라 데이터 파이프라인인 경우가 많다. 카네기멜런대 딥러닝 수업 실습에서 짚은 Dataset과 DataLoader의 역할 분담, 병목을 재는 방법, 속도를 끌어올리는 여덟 가지 기법을 정리했다.
핵심 내용 읽기 →
카네기멜런대 딥러닝 수업의 파이토치 데이터로더 실습을 정리했다. 배치와 셔플이 필요한 이유부터 drop_last, 지연 로딩, 커스텀 샘플러와 collate 함수, num_workers와 핀 메모리 설정까지 실무 기준으로 짚는다.
핵심 내용 읽기 →
카카오 광고 추천팀이 전환 최적화 모델을 딥러닝으로 옮기며 겪은 데이터 병목과 해법을 정리했다. 인포메이션 밸류 기반 피처 셀렉션으로 학습 데이터를 10분의 1로 줄이고도 성능은 오히려 올린 과정과 수치를 짚는다.
핵심 내용 읽기 →
카카오 추천팀을 거쳐 가상자산 거래 플랫폼에서 일하는 현직 엔지니어가 데이터 엔지니어의 실제 업무 범위와 채용에서 보는 역량, 학생이 쌓아야 할 기본기와 경험, AI 코딩 도구 시대에도 흔들리지 않는 준비 방법을 정리했다.
핵심 내용 읽기 →
자기 채널 자막 전부로 모델을 파인튜닝했다가 결과가 엉망이 된 개발자가, 훈련에 들어가기 전 데이터 파이프라인 네 단계와 페르소나 오버샘플링·학습 샘플 길이 최적화 요령을 실제 코드와 함께 정리했다.
핵심 내용 읽기 →
로봇 학습의 진짜 병목은 모델 구조가 아니라 행동 데이터다. DexCap과 AirExo, AirExo-2가 사람의 시연을 어떻게 로봇이 배울 수 있는 형태로 바꾸는지, 그 변환 파이프라인을 정리했다.
핵심 내용 읽기 →
애저 SQL의 변경 이벤트 스트리밍을 패브릭으로 흘려보내 시계열 이상 탐지로 봇의 비정상 티켓 구매를 잡아내는 시연을 정리했다. 임계값 대신 최근 구간만 지정하는 방식과 액티베이터 자동 대응 연결까지 다룬다.
핵심 내용 읽기 →
서울대 DSBA 연구실의 온톨로지 스터디 실습을 정리했다. SQL과 SPARQL의 차이, 트리플 패턴을 맞추는 문법, 표 데이터를 RDF 트리플로 바꾸는 파이프라인, 외부 식별자를 하나로 잇는 방법까지 따라간다.
핵심 내용 읽기 →
학습 서버의 저장 공간이 부족할 때 NAS를 활용하는 실전 구성 가이드. 실험 추적 도구 자체 호스팅, 모델·패키지 캐싱 프록시, 네트워크 너머 데이터 스트리밍까지 세 가지 사례와 실제 측정 결과를 정리했다.
핵심 내용 읽기 →
이커머스 이벤트를 실시간 수집해 정제·검증하고 BI로 서빙하는 데이터 파이프라인 구축 과정. Paimon과 Iceberg를 함께 쓴 이유, DLQ 오류 처리, 데이터 품질 검증과 복구 자동화까지 정리했다.
핵심 내용 읽기 →
MLOps는 데브옵스 원칙을 머신러닝에 적용한 실무 분야다. 모델 학습은 전체의 20%에 불과하며, 데이터 파이프라인·배포·모니터링 같은 엔지니어링이 성패를 가른다는 점을 프로젝트 관점에서 정리했다.
핵심 내용 읽기 →
AI 도구가 SQL·DAX 쿼리 등 분석가의 반복 업무를 자동화하면서 기업은 분석가에게 데이터 엔지니어링 기여를 기대한다. 분석가가 익혀야 할 데이터 엔지니어링 스킬맵을 정리했다.
핵심 내용 읽기 →