EoMT 논문 리뷰: ViT 하나로 이미지 세그멘테이션, 어댑터와 픽셀 디코더를 걷어내다
대규모로 사전학습된 ViT는 어댑터와 픽셀 디코더 없이도 이미지 분할을 해낸다는 EoMT 논문을 정리했다. 구성 요소를 하나씩 걷어내며 속도는 약 4.4배 빨라지고 정확도 손실은 1.1 PQ에 그친 실험과 마스크 어닐링 기법까지 살펴본다.
핵심 내용 읽기 →AI TOPIC
이미지 세그멘테이션 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

대규모로 사전학습된 ViT는 어댑터와 픽셀 디코더 없이도 이미지 분할을 해낸다는 EoMT 논문을 정리했다. 구성 요소를 하나씩 걷어내며 속도는 약 4.4배 빨라지고 정확도 손실은 1.1 PQ에 그친 실험과 마스크 어닐링 기법까지 살펴본다.
핵심 내용 읽기 →
메타가 공개한 SAM 3는 짧은 명사구만 입력하면 이미지와 영상 속 해당 개체를 모두 찾아 분할하고 추적한다. 디텍터와 트래커 분리, 프레즌스 토큰, 사람과 AI가 함께 만든 데이터 엔진을 짚었다.
핵심 내용 읽기 →