비전 언어 모델 탈옥 연구: 이미지 속 사물을 바꿔 안전장치를 우회하는 네 가지 공격
폴란드 연구자가 공개한 비전 언어 모델 탈옥 연구를 정리했다. 위험한 사물을 바나나로 바꿔 넣거나 기호로 문장을 암호화하는 방식으로 최신 모델의 거부 장치가 어떻게 무력해지는지, 왜 이미지 쪽이 더 허술한지 짚는다.
핵심 내용 읽기 →AI TOPIC
비전-언어 모델 관련 핵심 뉴스와 활용 인사이트 23편을 최신순으로 모았습니다.

폴란드 연구자가 공개한 비전 언어 모델 탈옥 연구를 정리했다. 위험한 사물을 바나나로 바꿔 넣거나 기호로 문장을 암호화하는 방식으로 최신 모델의 거부 장치가 어떻게 무력해지는지, 왜 이미지 쪽이 더 허술한지 짚는다.
핵심 내용 읽기 →
비전-언어 사전학습 모델 UNITER를 다룬 논문 리뷰 발표를 정리했다. 이미지 영역 특징과 문장 토큰을 한 트랜스포머에 함께 넣고, 단어와 영역 마스킹 예측부터 최적 수송을 쓴 단어-영역 정렬까지 네 가지 과제로 학습하는 구조를 설명한다.
핵심 내용 읽기 →
각각의 인코더로 정렬하던 방식에서 융합 전에 정렬하는 방식까지, 비전-언어 사전학습의 계보를 짚고 여기에 모달리티 내부 대조 학습과 지역 정보 상호정보량을 더한 TCL 논문을 국내 스터디 세미나 발표로 정리했다.
핵심 내용 읽기 →
구글 딥마인드 연구자가 여름학교에서 강의한 비전-언어 모델 개관을 정리했다. CLIP 대조학습의 구조와 한계, 세밀한 정합을 노린 SPARC, CoCa와 PaLI가 남긴 설계 교훈, 그리고 실제 응용 사례까지 짚는다.
핵심 내용 읽기 →
ETH 취리히 로봇 학습 강의에 초청된 메타 연구자가 컴퓨터 비전이 8년 만에 쓸 만해진 과정을 사전학습·중간학습·미세조정 레시피로 정리하고, 규모 확장의 조건과 데이터 필터링의 함정, 추론과 계획이라는 남은 과제를 짚었다.
핵심 내용 읽기 →
MIT와 IBM 연구진이 만든 ChartNet은 차트 이미지와 그림 코드, 데이터 표, 요약을 함께 담은 100만 건 규모 합성 데이터셋이다. 작은 오픈소스 모델의 차트 이해 성능을 끌어올린 방식을 정리했다.
핵심 내용 읽기 →
웹 에이전트 평가는 보통 과제 성공 여부만 본다. 카네기멜런대 연구자는 계획 능력을 시간 순서 판단·미래 상태 예측·행동 선택으로 쪼갠 뒤 기존 데이터셋을 재활용해 값싸게 채점하는 방법을 제시했다.
핵심 내용 읽기 →
한 시간이 넘는 축구 중계 영상에서 어떤 선수가 언제 무슨 동작을 했는지 찾아내는 액션 스포팅 과제를, 비전·언어 모델과 씬 그래프 두 방식으로 직접 구현해 비교한 서울대 수업 프로젝트 발표를 정리했다. 성적과 실패 원인까지 짚는다.
핵심 내용 읽기 →
마이크로소프트 리서치 인도 학술 서밋의 멀티모달·체화 지능 세션 정리. 시각 지각만 떼어내 측정한 진단 벤치마크와 라벨 없는 소형 모델 강화, 영상 속 인물 추적, 의료 영상 판독 연구가 차례로 이어졌다.
핵심 내용 읽기 →
메타가 폐쇄형 모델의 출력에 전혀 기대지 않고 처음부터 만든 비전 언어 모델 PLM을 살펴본다. 라마 3과 퍼셉션 인코더를 잇는 구조, 워밍업부터 고해상도 미세조정까지 3단계 학습법, 사람이 주석한 1400만 샘플의 역할을 정리했다.
핵심 내용 읽기 →
CLIP 같은 비전-언어 모델의 프롬프트를 연속값 대신 이산 코드북으로 양자화하면 학습하지 않은 클래스에서 성능이 오른다. 양자화 오류를 일반화에 유리한 노이즈로 활용한 QPrompt 논문 리뷰를 정리했다.
핵심 내용 읽기 →
고려대 DMQA 오픈 세미나를 정리했다. 픽셀만 보던 산업 이상 탐지가 비전-언어 모델을 만나 어떻게 달라졌는지, 그리고 가장 좋은 성능조차 사람보다 20%가량 낮은 현재의 한계와 이를 넘으려는 세 갈래 연구 방향을 짚는다.
핵심 내용 읽기 →
이미지에 없는 사물을 설명하는 비전 언어 모델의 환각을 줄이려는 OViP 논문 발표를 정리했다. 학습 중 부정 이미지를 직접 생성해 쓰는 구조와, 환각만 잡다 일반 성능을 놓친 기존 기법의 문제를 함께 짚는다.
핵심 내용 읽기 →
VLM은 갑자기 등장한 기술이 아니다. 따로 발전해온 컴퓨터 비전과 자연어 처리를 왜 이제야 합치게 됐는지, 어디에 먼저 쓰일지 서울대 AI 박사의 설명으로 정리했다.
핵심 내용 읽기 →
CVPR 2024 구두 발표 논문 InternVL은 비전 인코더를 60억 파라미터로 키우고 언어 미들웨어를 끼워 넣었다. 기존 경량 연결층의 한계와 3단계 학습, 스위스 아미 나이프식 조합 구조를 정리했다.
핵심 내용 읽기 →
CVPR 2025 하이라이트 논문 리뷰. 대규모 비전 언어 모델 안에는 텍스트가 가리키는 영역에 이미 집중하는 어텐션 헤드가 존재하며, 이를 골라 쓰면 추가 학습 없이도 객체를 찾아낼 수 있다.
핵심 내용 읽기 →
1억 3500만 파라미터 텍스트 모델에 사전학습 ViT와 Q-Former, LoRA를 붙여 이미지를 이해하게 만드는 과정을 단계별로 정리했다. 캡션 5만 장과 몇 시간 학습, 50센트 남짓한 비용으로 시각 능력을 얻는 방법이다.
핵심 내용 읽기 →
ETH 취리히 연구진이 발표한 오픈프론티어는 3D 지도를 새로 만들지 않고 카메라 화면에서 미탐험 영역의 단서를 찾아, 사전학습된 비전-언어 모델로 목표에 가까운 방향을 고르는 로봇 내비게이션 기법이다.
핵심 내용 읽기 →
글과 이미지를 하나의 공동 임베딩 공간에서 다루는 비전 언어 모델(VLM)의 기본 원리를 CLIP, 인코더 구성, 초기·후기·교차어텐션 융합, VLA·VLP 응용까지 정리했다.
핵심 내용 읽기 →
구글의 비전-언어 모델 PaliGemma를 파이토치로 처음부터 구현하는 심층 강의. 비전 트랜스포머와 대조 학습(CLIP·SigLIP), 이미지·텍스트 임베딩 결합, KV 캐시, 회전 위치 인코딩, 정규화까지 개념과 코드로 설명한다.
핵심 내용 읽기 →
이미지와 텍스트를 하나의 입력으로 다루는 비전-언어 모델의 작동 원리를 정리했다. 멀티모달 학습, BERT 기반 아키텍처, 대조 학습, 디퓨전, CLIP·DALL·E·ALIGN·Florence까지 핵심을 짚는다.
핵심 내용 읽기 →
고려대 김성범 교수 연구실 세미나가 데이터를 공유하지 않는 연합학습에 비전-언어 모델(VLM) 프롬프트 튜닝을 접목한 세 연구 PromptFL·FedOTP·FedMGP로 데이터 이질성 문제를 짚는다.
핵심 내용 읽기 →
텍스트만 다루던 LLM에 시각을 더한 비전 언어 모델(VLM). 비전 인코더와 프로젝터로 이미지를 토큰으로 바꿔 사진·문서·그래프를 해석하는 원리와 한계를 IBM 설명으로 정리했다.
핵심 내용 읽기 →