트랜스포머 및 CNN 기반 딥페이크 탐지
딥페이크 생성 기술의 발전은 디지털 미디어의 신뢰성을 위협하며, 사생활 침해, 보안 문제, 허위 정보 유포 등 심각한 위험을 초래하고 있습니다. 딥러닝(DL) 기반 탐지 방법론이 유망하지만, 적용의 일관성 부족, 표준화된 파이프라인 부재, 그리고 데이터셋 간 일반화 능력의 한계로 인해 실제 환경에서의 신뢰성 있는 배포가 어렵습니다. 본 연구는 비디오 딥페이크 탐지를 위해 트랜스포머 및 CNN 기반 아키텍처를 종합적으로 평가합니다. 여러 벤치마크 데이터셋과 새롭게 구축된 얼굴 재연(facial-reenactment) 데이터셋을 활용하여 교차 데이터셋 일반화 성능과 제한된 미세 조정(10-30%)을 통한 사전 학습 효과를 분석했습니다. 또한, 시간 윈도우 길이가 탐지 성능에 미치는 영향을 탐구했습니다. 실험 결과, TimeSformer 모델이 96프레임 클립과 30% 미세 조정을 통해 78.4%의 정확도, 0.801 AUC, 77.0% F1-점수를 달성하며 가장 우수한 성능을 보였습니다. 이는 시공간 통합 모델링의 이점을 입증합니다. 모든 모델은 적절한 미세 조정(20% 이상에서 성능 정체)을 통해 성능 향상을 보였으며, 클립 길이 증가는 시간적 인지 모델의 성능을 향상시켜 확장된 시간적 맥락의 중요성을 강조합니다. 이 연구는 현재 아키텍처의 강점과 한계에 대한 실증적 증거를 제공하며, 견고하고 일반화 가능한 딥페이크 탐지기 개발을 위한 향후 연구 및 실제 배포에 중요한 지침을 제시합니다.