서울대 VIP 연구실 2026 연구 소개 — 비디오 요약·멀티모달 LLM·3D 복원 한눈에
서울대 시각정보처리 연구실이 2026년 연구를 직접 소개했다. 비디오 요약의 진짜 병목은 어디인지, 멀티모달 LLM의 레이어는 왜 낭비되는지, 사진 몇 장으로 움직이는 물체를 어떻게 복원하는지까지 정리했다.
핵심 내용 읽기 →AI TOPIC
멀티모달 LLM 관련 핵심 뉴스와 활용 인사이트 3편을 최신순으로 모았습니다.

서울대 시각정보처리 연구실이 2026년 연구를 직접 소개했다. 비디오 요약의 진짜 병목은 어디인지, 멀티모달 LLM의 레이어는 왜 낭비되는지, 사진 몇 장으로 움직이는 물체를 어떻게 복원하는지까지 정리했다.
핵심 내용 읽기 →
스탠퍼드 CS547 HCI 세미나 강연은 차트에 글을 많이 넣을수록 사람들이 더 선호했고 상당수는 그래프 없이 문장만 원했다는 실험 결과를 소개하며, 이를 설명하려는 인지 이론들과 멀티모달 언어 모델의 결합 구조까지 함께 짚었다.
핵심 내용 읽기 →
영상 LLM은 모든 프레임을 그대로 넣어 비효율적이다. STORM은 맘바 층으로 시간 맥락을 녹인 뒤 토큰을 압축해, 8배 적은 토큰으로 긴 영상 이해를 더 잘 해낸다.
핵심 내용 읽기 →