다국어 NLP 강의 정리: 데이터 격차, 다국어성의 저주, 토크나이저 불균형과 전이 학습 전략
CMU 고급 자연어 처리 강의가 짚은 다국어 NLP의 현실을 정리했다. 언어별 데이터 격차와 형태론 문제, 다국어성의 저주와 토크나이저 불균형, 번역 모델과 평가 지표, 전이 학습과 능동 학습 전략까지 살펴본다.
핵심 내용 읽기 →AI TOPIC
능동 학습 관련 핵심 뉴스와 활용 인사이트 4편을 최신순으로 모았습니다.

CMU 고급 자연어 처리 강의가 짚은 다국어 NLP의 현실을 정리했다. 언어별 데이터 격차와 형태론 문제, 다국어성의 저주와 토크나이저 불균형, 번역 모델과 평가 지표, 전이 학습과 능동 학습 전략까지 살펴본다.
핵심 내용 읽기 →
예시나 프롬프트만으로는 사람의 의도가 제대로 전달되지 않는다. MIT 제이컵 안드레아스 교수가 카네기멜런대 로보틱스 세미나에서 소개한, 언어 모델이 스스로 좋은 질문을 던지게 만드는 연구들을 정리했다.
핵심 내용 읽기 →
같은 모델·같은 입력인데 판단이 오락가락하는 AI 에이전트. 그 원인이 결정 경계의 '회색 지대'임을 짚고, 능동학습과 시맨틱·에피소딕 메모리로 일관성을 높이는 방법을 소개한다.
핵심 내용 읽기 →
액티브 러닝은 가장 적은 학습 데이터로 전체 데이터 라벨링을 최적화하고 최고의 모델을 만드는 지도학습 방식입니다. 불확실성 샘플링과 위원회 질의 같은 쿼리 전략, 사람이 개입하는 라벨링 루프를 쉽게 설명합니다.
핵심 내용 읽기 →