약지도 비디오 이상탐지 정리: MIL 랭킹에서 CLIP-TSA, VadCLIP, DSANet까지
영상 전체 라벨만으로 이상 구간을 찾는 약지도 비디오 이상탐지 연구를 고려대 DMQA 공개 세미나 내용으로 정리했다. MIL 랭킹으로 문제를 정식화한 초기 연구부터 CLIP과 텍스트 정렬을 쓰는 최신 기법까지 짚는다.
핵심 내용 읽기 →AI TOPIC
CLIP 관련 핵심 뉴스와 활용 인사이트 15편을 최신순으로 모았습니다.

영상 전체 라벨만으로 이상 구간을 찾는 약지도 비디오 이상탐지 연구를 고려대 DMQA 공개 세미나 내용으로 정리했다. MIL 랭킹으로 문제를 정식화한 초기 연구부터 CLIP과 텍스트 정렬을 쓰는 최신 기법까지 짚는다.
핵심 내용 읽기 →
언어 모델이 사진과 영상, 소리를 이해하게 된 과정을 비전 트랜스포머와 CLIP, 플라밍고와 Q-Former, 오디오 모델까지 따라가며 모달리티마다 반복되는 세 단계 설계로 정리했다.
핵심 내용 읽기 →
이미지 인코더와 텍스트 인코더를 같은 임베딩 공간에 맞추는 CLIP의 대조 학습 방식과, 학습 때 본 적 없는 데이터도 분류해내는 제로샷 추론의 원리, 그리고 선형 프로브의 쓰임새까지 차근차근 정리했습니다.
핵심 내용 읽기 →
AlexNet에서 CLIP까지, 정답 라벨 대신 자연어 설명으로 학습하는 방식이 컴퓨터 비전을 어떻게 재편했는지 CodeEmporium의 해설 강의를 토대로 대조 학습과 제로샷 분류를 중심으로 정리했다.
핵심 내용 읽기 →
파운데이션 모델에는 엄밀한 정의가 없지만 공통된 특징은 있다. 거대한 규모, 라벨 없는 대량 학습 데이터, 그리고 무엇보다 재사용성이다. 대표 모델 다섯 가지로 그 기준을 풀어본다.
핵심 내용 읽기 →
AI 이미지는 알아볼 수 없는 무작위 노이즈에서 시작한다. 확산 모델이 노이즈를 더했다가 거꾸로 제거하며 그림을 만들어내는 순방향·역방향 과정, CLIP 텍스트 조건화, UNet과 잠재공간까지 쉽고 자세하게 정리했다.
핵심 내용 읽기 →
MIT 강의로 풀어보는 이미지 생성 AI의 구조. 잡음을 조금씩 걷어내는 확산 모델, 이미지를 받아 이미지를 내놓는 U-Net, 문장과 그림을 같은 공간에 놓는 CLIP까지 생성의 뼈대를 차례로 설명한다.
핵심 내용 읽기 →
확산 모델 없이 딥드림과 CLIP만으로 이미지를 특정 개념 쪽으로 서서히 바꾸는 실험. 역전파·대조학습·어그멘테이션 원리를 쉽게 풀었다.
핵심 내용 읽기 →
글과 이미지를 하나의 공동 임베딩 공간에서 다루는 비전 언어 모델(VLM)의 기본 원리를 CLIP, 인코더 구성, 초기·후기·교차어텐션 융합, VLA·VLP 응용까지 정리했다.
핵심 내용 읽기 →
이미지와 텍스트를 하나의 입력으로 다루는 비전-언어 모델의 작동 원리를 정리했다. 멀티모달 학습, BERT 기반 아키텍처, 대조 학습, 디퓨전, CLIP·DALL·E·ALIGN·Florence까지 핵심을 짚는다.
핵심 내용 읽기 →
텍스트·이미지·오디오·영상을 함께 다루는 멀티모달 AI의 작동 원리와 인코더·공유 임베딩·교차 어텐션, CLIP·BLIP-2·Flamingo·Gemini 같은 대표 모델을 쉽게 정리합니다.
핵심 내용 읽기 →
텍스트로 이미지를 만드는 DALL-E와 CLIP 학습 원리부터, ChatGPT가 여러 모달리티를 다루는 방식과 '멀티모달 모델 vs 멀티모달 인터페이스'의 차이까지 쉽게 풀어 설명합니다.
핵심 내용 읽기 →
이미지·텍스트·오디오를 한데 묶는 멀티모달 AI의 기본 원리를 정렬·대조학습·마스킹·통합학습 관점에서 설명하고, CLIP·이미지바인드·플라밍고 등 대표 연구를 정리했다.
핵심 내용 읽기 →
이미지에 무엇이 담겼는지 챗봇이 설명하고, 문장 한 줄로 그림을 만들어내는 비결은 CLIP입니다. 그림과 글을 같은 좌표 공간에 나란히 놓아 비교하는 학습 방식과 제로샷 분류, 확산 모델 활용까지 쉽게 풀어봅니다.
핵심 내용 읽기 →
텍스트로 이미지와 영상을 만드는 확산 모델이 무작위 노이즈에서 시작해 어떻게 사실적인 결과를 만드는지, CLIP·DDPM·DDIM·분류기 없는 안내까지 핵심 원리를 풀어 설명한다.
핵심 내용 읽기 →