자율주행을 위한 비전-언어 모델: CLIP 기반 동적 장면 이해
Vision-Language Models for Autonomous Driving: CLIP-Based Dynamic Scene Understanding
Mohammed Elhenawy, Huthaifa I. Ashqar, Andry Rakotonirainy 외 3인·Electronics·발표 2025.03· 33 인용
최근 1년 33회 인용· 떠오르는 연구
한국어 핵심 요약
자율주행 시스템의 안전성 향상, 운전자 의사결정 설명, 그리고 주행 영상 분석을 위한 장면 이해는 필수적입니다. 본 연구는 동적 장면 검색 시스템을 개발했으며, 이는 CLIP(Contrastive Language–Image Pretraining) 모델을 활용하여 엣지 디바이스에 실시간 배포 가능하도록 최적화되었습니다.
제안된 시스템은 복잡한 시나리오에서 GPT-4o의 제로샷(zero-shot) 기능을 포함한 기존의 최첨단 인컨텍스트 학습 방법론을 능가하는 성능을 보였습니다. 약 80시간 분량의 주행 영상이 포함된 Honda Scenes 데이터셋에 대해 프레임 단위 분석을 수행하여, CLIP 모델이 자연어 감독을 통해 시각적 개념을 학습하는 견고함을 확인했습니다.
특히, ViT-L/14 및 ViT-B/32와 같은 CLIP 모델을 미세 조정(fine-tuning)했을 때 장면 분류 성능이 크게 향상되어, 최고 F1-점수 91.1%를 달성했습니다. 이는 시스템이 신속하고 정확한 장면 인식을 제공하여 첨단 운전자 보조 시스템(ADAS)의 핵심 요구사항을 충족할 수 있음을 입증합니다.
본 연구는 CLIP 모델이 동적 장면 이해 및 분류를 위한 확장 가능하고 효율적인 프레임워크를 제공할 잠재력을 보여줍니다. 나아가 운전자 행동, 도로 조건, 안전 중요 시나리오에 대한 깊은 이해를 촉진하여, 더욱 스마트하고 안전하며 상황 인지 능력이 뛰어난 자율주행 시스템 개발의 기반을 마련했습니다.
섹션 미리보기
연구 배경
자율주행 시스템의 안전성 강화와 운전자 의사결정 설명을 위해 동적 장면 이해는 필수적입니다. 기존 방법론의 한계를 극복하고 실시간 배포가 가능한 효율적인 장면 인식 시스템의 필요성이 대두되었습니다.
핵심 발견
CLIP 모델 기반의 동적 장면 검색 시스템은 복잡한 시나리오에서 GPT-4o를 포함한 최첨단 인컨텍스트 학습 방법을 능가했습니다. 미세 조정을 통해 장면 분류 F1-점수 91.1%를 달성하며, 신속하고 정확한 장면 인식 능력을 입증했습니다.
관련 컴퓨터 과학 논문
부분 관측 다중 모드 헬스케어 예측을 위한 차등 프라이빗 연합 학습
2026·0
미주신경성 실신 탐지: 프라이버시 보호 ML
2026·0
AI 생성 대화의 자연스러움: 턴 주고받기 및 역할 행동 분석
2026·0
해양 공간 데이터 인프라와 오픈 사이언스 연계
2026·0