메타 퍼셉션 언어 모델(PLM) 분석: 폐쇄형 증류 없이 만든 개방형 비전 언어 모델의 학습법
메타가 폐쇄형 모델의 출력에 전혀 기대지 않고 처음부터 만든 비전 언어 모델 PLM을 살펴본다. 라마 3과 퍼셉션 인코더를 잇는 구조, 워밍업부터 고해상도 미세조정까지 3단계 학습법, 사람이 주석한 1400만 샘플의 역할을 정리했다.
핵심 내용 읽기 →AI TOPIC
영상 이해 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

메타가 폐쇄형 모델의 출력에 전혀 기대지 않고 처음부터 만든 비전 언어 모델 PLM을 살펴본다. 라마 3과 퍼셉션 인코더를 잇는 구조, 워밍업부터 고해상도 미세조정까지 3단계 학습법, 사람이 주석한 1400만 샘플의 역할을 정리했다.
핵심 내용 읽기 →
영상 LLM은 모든 프레임을 그대로 넣어 비효율적이다. STORM은 맘바 층으로 시간 맥락을 녹인 뒤 토큰을 압축해, 8배 적은 토큰으로 긴 영상 이해를 더 잘 해낸다.
핵심 내용 읽기 →