0. Abstract- 본 연구에서는 사전 학습 및 미세 조정 과정 없이 얼어붙은(frozen) CLIP 모델을 직접 활용하여 약지도 비디오 이상 탐지(WSVAD)를 위한 새로운 패러다임인 VadCLIP을 제안- 기존 방식: 프레임 수준의 이진 분류를 위해 추출된 특징을 약지도 분류기에 직접 입력- VadCLIP은 CLIP의 시각-언어 간 미세한 연관성을 최대한 활용하며 이중 분기(dual branch)를 도입* 첫번째 분기: 거친 수준(coarse-grained)의 이진 분류를 위해 시각적 특징을 단순히 활용* 두번째 분기: 미세한 수준(fine-grained)의 언어-이미지 정렬(alignment)을 충분히 활용 => 이중 분기의 이점을 통해 VadCLIP은 CLIP에서 사전 학습된 지식을 WSVAD..