VideoChat3 논문 정리: 40억 파라미터 오픈소스 영상 AI가 실시간 이해를 푸는 법
난징대 등이 공개한 VideoChat3는 파라미터 40억 개로 영상 구간 찾기에서 대형 상용 모델을 앞섰다. 프레임 16배 압축과 침묵·대기·응답 3단 판단, 학습 데이터까지 전부 공개한 전략과 한계를 함께 정리했다.
핵심 내용 읽기 →AI TOPIC
영상AI 관련 핵심 뉴스와 활용 인사이트 2편을 최신순으로 모았습니다.

난징대 등이 공개한 VideoChat3는 파라미터 40억 개로 영상 구간 찾기에서 대형 상용 모델을 앞섰다. 프레임 16배 압축과 침묵·대기·응답 3단 판단, 학습 데이터까지 전부 공개한 전략과 한계를 함께 정리했다.
핵심 내용 읽기 →
AI 엔지니어 콘퍼런스 강연 정리. 영상을 프레임 더미가 아니라 시공간 볼륨으로 보고, 단순 검색을 넘어 기억(메모리)을 갖춘 영상 이해 시스템을 만드는 다섯 가지 원칙과 컨텍스트 그래프, 그리고 TwelveLabs의 실제 데모를 소개한다.
핵심 내용 읽기 →