Caramel LabCaramel Lab
#

CLIP

1의 한국어 분석 — 최신순으로 정렬했어요

컴퓨터 과학발표 2025.03· 33최근 1년 33

자율주행을 위한 비전-언어 모델: CLIP 기반 동적 장면 이해

자율주행 시스템의 안전성 향상, 운전자 의사결정 설명, 그리고 주행 영상 분석을 위한 장면 이해는 필수적입니다. 본 연구는 동적 장면 검색 시스템을 개발했으며, 이는 CLIP(Contrastive Language–Image Pretraining) 모델을 활용하여 엣지 디바이스에 실시간 배포 가능하도록 최적화되었습니다. 제안된 시스템은 복잡한 시나리오에서 GPT-4o의 제로샷(zero-shot) 기능을 포함한 기존의 최첨단 인컨텍스트 학습 방법론을 능가하는 성능을 보였습니다. 약 80시간 분량의 주행 영상이 포함된 Honda Scenes 데이터셋에 대해 프레임 단위 분석을 수행하여, CLIP 모델이 자연어 감독을 통해 시각적 개념을 학습하는 견고함을 확인했습니다. 특히, ViT-L/14 및 ViT-B/32와 같은 CLIP 모델을 미세 조정(fine-tuning)했을 때 장면 분류 성능이 크게 향상되어, 최고 F1-점수 91.1%를 달성했습니다. 이는 시스템이 신속하고 정확한 장면 인식을 제공하여 첨단 운전자 보조 시스템(ADAS)의 핵심 요구사항을 충족할 수 있음을 입증합니다. 본 연구는 CLIP 모델이 동적 장면 이해 및 분류를 위한 확장 가능하고 효율적인 프레임워크를 제공할 잠재력을 보여줍니다. 나아가 운전자 행동, 도로 조건, 안전 중요 시나리오에 대한 깊은 이해를 촉진하여, 더욱 스마트하고 안전하며 상황 인지 능력이 뛰어난 자율주행 시스템 개발의 기반을 마련했습니다.

연구 트렌드로 돌아가기