Sa2VA: 이미지 및 비디오 밀집 접지 이해 통합 모델
Sa2VA: Marrying SAM2 With MLLM for Dense Grounded Understanding of Images and Videos
Haobo Yuan, Xiangtai Li, Tao Zhang 외 5인·IEEE Transactions on Pattern Analysis and Machine Intelligence·발표 2026.08· 18 인용
최근 1년 18회 인용· 떠오르는 연구
한국어 핵심 요약
기존 멀티모달 대규모 언어 모델(MLLM)은 특정 모달리티 및 작업에 국한되는 한계가 있습니다. 본 연구는 이미지와 비디오 모두에 대한 밀집 접지 이해를 위한 최초의 포괄적이고 통합된 모델인 Sa2VA를 제안합니다. Sa2VA는 참조 분할 및 대화를 포함한 광범위한 이미지 및 비디오 작업을 지원하며, 최소한의 단일 단계 지시 튜닝만 필요합니다.
Sa2VA는 기반 비디오 분할 모델인 SAM-2와 고급 비전-언어 모델인 MLLM을 결합하여 텍스트, 이미지, 비디오를 공유 LLM 토큰 공간으로 통합합니다. LLM을 활용하여 Sa2VA는 SAM-2가 정밀한 마스크를 생성하도록 안내하는 지시 토큰을 생성함으로써 정적 및 동적 시각 콘텐츠에 대한 접지된 멀티모달 이해를 가능하게 합니다. 또한, 모델 성능 향상을 위해 복잡한 비디오 장면에서 7만 2천 개 이상의 객체 표현을 포함하는 자동 레이블링 데이터셋인 Ref-SAV를 도입했습니다.
실험 결과, Sa2VA는 특히 참조 비디오 객체 분할에서 여러 작업에 걸쳐 강력한 성능을 달성하며 복잡한 실제 애플리케이션에 대한 잠재력을 입증했습니다. Sa2VA는 Qwen-VL 및 Intern-VL을 포함한 다양한 MLLM으로 쉽게 확장될 수 있으며, 이는 현재 오픈소스 MLLM의 빠른 발전과 함께 업데이트될 수 있습니다.
섹션 미리보기
연구 배경
기존 멀티모달 대규모 언어 모델(MLLM)은 특정 모달리티와 작업에 국한되어 이미지와 비디오 전반에 걸친 포괄적인 이해에 한계가 있었습니다. 이러한 제약을 극복하고 정적 및 동적 시각 콘텐츠를 통합적으로 이해하는 모델의 필요성이 대두되었습니다.
핵심 발견
Sa2VA는 SAM-2와 MLLM을 결합하여 이미지와 비디오의 밀집 접지 이해를 위한 통합 프레임워크를 제공합니다. 특히 참조 비디오 객체 분할에서 뛰어난 성능을 보였으며, 다양한 MLLM으로 확장 가능하여 복잡한 실제 애플리케이션에 큰 잠재력을 가집니다.
관련 컴퓨터 과학 논문
IoT 엣지 네트워크 효율적 DDoS 탐지 위한 적응형 연합 학습
2026·0
몰입형 VR 시점 공유 기법 연구
2026·0
중동 전립선암 AI 진단 모델 유효성 검증
2026·1
유한 이중 관계 프레임 속성을 갖는 S4 양상 논리
2026·1