Caramel LabCaramel Lab
#

시각언어모델

1편의 한국어 분석 — 최신순으로 정렬했어요

컴퓨터 과학발표 2026.08· 7최근 1년 7회

방사선 다중작업 대화형 시각-언어 모델 RadVLM

흉부 X선(CXR)의 광범위한 사용과 영상의학과 전문의 부족은 자동화된 CXR 분석 및 AI 보조 보고에 대한 관심을 증대시켰습니다. 기존 시각-언어 모델(VLM)은 보고서 생성이나 이상 감지와 같은 특정 작업에서 가능성을 보였지만, 대화형 진단 기능은 부족했습니다. 본 연구는 CXR 해석을 위한 작고 다중작업 대화형 VLM인 RadVLM을 제안합니다. 저자들은 100만 개 이상의 이미지-명령 쌍으로 구성된 대규모 CXR 명령 데이터셋을 구축하고 표준화했습니다. 이 데이터셋은 보고서 생성, 이상 분류, 시각적 접지(visual grounding)를 포함한 단일 턴 작업과 구조화된 CXR 속성에서 생성된 합성 다중 턴 대화를 통합합니다. 이 명령 데이터셋으로 RadVLM을 미세 조정하고, 재구현된 기준 VLM들과 함께 다양한 작업에서 성능을 평가했습니다. 평가된 기준 모델들 중에서 RadVLM은 대화 기능과 시각적 접지에서 가장 강력한 성능을 달성했으며, 다른 방사선 작업에서도 경쟁력을 유지했습니다. 작업별 미세 조정과 전체 다중작업 미세 조정을 비교한 결과, 특히 자원이 부족한 접지 및 대화 설정에서 공동 학습의 이점이 일관되게 나타났습니다. 이러한 결과는 RadVLM이 구조화된 CXR 해석 및 대화 기능을 위한 연구 프로토타입으로서, 보다 효과적이고 접근 가능한 진단 워크플로우를 지원할 수 있음을 시사합니다.

연구 트렌드로 돌아가기