Caramel LabCaramel Lab

Sa2VA: 이미지 및 비디오 밀집 접지 이해 통합 모델

Sa2VA: Marrying SAM2 With MLLM for Dense Grounded Understanding of Images and Videos

Haobo Yuan, Xiangtai Li, Tao Zhang 외 5인·IEEE Transactions on Pattern Analysis and Machine Intelligence·발표 2026.08· 18 인용
최근 1년 18회 인용· 떠오르는 연구

한국어 핵심 요약

기존 멀티모달 대규모 언어 모델(MLLM)은 특정 모달리티 및 작업에 국한되는 한계가 있습니다. 본 연구는 이미지와 비디오 모두에 대한 밀집 접지 이해를 위한 최초의 포괄적이고 통합된 모델인 Sa2VA를 제안합니다. Sa2VA는 참조 분할 및 대화를 포함한 광범위한 이미지 및 비디오 작업을 지원하며, 최소한의 단일 단계 지시 튜닝만 필요합니다. Sa2VA는 기반 비디오 분할 모델인 SAM-2와 고급 비전-언어 모델인 MLLM을 결합하여 텍스트, 이미지, 비디오를 공유 LLM 토큰 공간으로 통합합니다. LLM을 활용하여 Sa2VA는 SAM-2가 정밀한 마스크를 생성하도록 안내하는 지시 토큰을 생성함으로써 정적 및 동적 시각 콘텐츠에 대한 접지된 멀티모달 이해를 가능하게 합니다. 또한, 모델 성능 향상을 위해 복잡한 비디오 장면에서 7만 2천 개 이상의 객체 표현을 포함하는 자동 레이블링 데이터셋인 Ref-SAV를 도입했습니다. 실험 결과, Sa2VA는 특히 참조 비디오 객체 분할에서 여러 작업에 걸쳐 강력한 성능을 달성하며 복잡한 실제 애플리케이션에 대한 잠재력을 입증했습니다. Sa2VA는 Qwen-VL 및 Intern-VL을 포함한 다양한 MLLM으로 쉽게 확장될 수 있으며, 이는 현재 오픈소스 MLLM의 빠른 발전과 함께 업데이트될 수 있습니다.

섹션 미리보기

연구 배경

기존 멀티모달 대규모 언어 모델(MLLM)은 특정 모달리티와 작업에 국한되어 이미지와 비디오 전반에 걸친 포괄적인 이해에 한계가 있었습니다. 이러한 제약을 극복하고 정적 및 동적 시각 콘텐츠를 통합적으로 이해하는 모델의 필요성이 대두되었습니다.

핵심 발견

Sa2VA는 SAM-2와 MLLM을 결합하여 이미지와 비디오의 밀집 접지 이해를 위한 통합 프레임워크를 제공합니다. 특히 참조 비디오 객체 분할에서 뛰어난 성능을 보였으며, 다양한 MLLM으로 확장 가능하여 복잡한 실제 애플리케이션에 큰 잠재력을 가집니다.

전체 8개 섹션 분석

내가 읽고 있는 논문도 이렇게 정리해드릴게요

연구 배경 · 방법론 · 결과 · 한계점까지 8개 섹션 풀 분석. PDF 업로드 한 번이면 끝.

내 논문 분석하기

관련 컴퓨터 과학 논문

컴퓨터 과학 전체 보기