LLM 강의 정리: 데이터셋 구축과 SFT, 기술보고서가 끝까지 공개하지 않는 학습의 나머지 절반
딥시크 V4 기술보고서는 60쪽인데 데이터 설명은 한 문단뿐이다. 대학 LLM 강의가 짚은 웹 크롤링과 저작권 문제, 필터링과 중복 제거, 합성 데이터 활용, 그리고 SFT가 실제로 하는 역할까지 차례로 정리했다.
핵심 내용 읽기 →AI TOPIC
데이터 필터링 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

딥시크 V4 기술보고서는 60쪽인데 데이터 설명은 한 문단뿐이다. 대학 LLM 강의가 짚은 웹 크롤링과 저작권 문제, 필터링과 중복 제거, 합성 데이터 활용, 그리고 SFT가 실제로 하는 역할까지 차례로 정리했다.
핵심 내용 읽기 →
EleutherAI 스텔라 비더만이 옥스퍼드·영국 AISI와 함께한 연구를 소개한다. 사전학습 데이터에서 생물학 위험 지식을 걸러낸 모델은 적대적 파인튜닝에도 오래 버텼지만, 이 방식이 통하는 조건은 생각보다 좁았다.
핵심 내용 읽기 →