체화 인공지능을 위한 시각-언어-행동 모델 연구
A Survey on Vision--Language--Action Models for Embodied AI
Yueen Ma, Zixing Song, Yuzheng Zhuang 외 2인·IEEE Transactions on Neural Networks and Learning Systems·발표 2026.04· 15 인용
최근 1년 13회 인용· 떠오르는 연구
한국어 핵심 요약
체화 인공지능(Embodied AI)은 물리적 세계에서 로봇이 작업을 수행하도록 제어하는 것을 포함하기에 인공 일반 지능(AGI)의 핵심 요소로 주목받고 있습니다. 최근 대규모 언어 모델(LLM)과 시각-언어 모델(VLM)의 성공을 기반으로, 언어 조건부 로봇 작업을 처리하고 행동을 생성하는 시각-언어-행동(VLA) 모델이 새로운 다중 모드 모델로 부상했습니다. 이처럼 빠르게 발전하는 VLA 모델 분야를 체계적으로 정리하기 위한 포괄적인 연구의 필요성이 증대되고 있습니다.
본 연구는 체화 인공지능을 위한 VLA 모델에 대한 최초의 종합적인 조사를 제시합니다. VLA 모델을 세 가지 주요 연구 분야로 분류하여 상세한 분류 체계를 제공합니다. 첫 번째는 VLA의 개별 구성 요소에 중점을 두며, 두 번째는 저수준 행동 예측에 능숙한 VLA 기반 제어 정책 개발에 전념합니다. 세 번째는 장기 작업을 하위 작업으로 분해하여 VLA가 더 일반적인 사용자 지침을 따르도록 안내하는 고수준 작업 계획자로 구성됩니다.
또한, 데이터셋, 시뮬레이터, 벤치마크 등 관련 리소스에 대한 광범위한 요약을 제공합니다. 마지막으로 VLA 모델이 직면한 과제를 논의하고 체화 인공지능 분야의 유망한 미래 방향을 제시합니다. 이 연구와 관련된 자료는 GitHub 저장소(https://github.com/yueen-ma/Awesome-VLA)에서 확인할 수 있습니다.
섹션 미리보기
연구 배경
체화 인공지능은 물리적 세계에서 로봇이 작업을 수행하도록 제어하는 AGI의 핵심 요소입니다. LLM과 VLM의 성공에 힘입어, 언어 조건부 로봇 작업을 처리하고 행동을 생성하는 시각-언어-행동(VLA) 모델이 새롭게 부상했습니다.
핵심 발견
본 연구는 VLA 모델을 개별 구성 요소, 저수준 행동 예측을 위한 제어 정책, 고수준 작업 계획자의 세 가지 주요 연구 분야로 분류하는 상세한 분류 체계를 제시합니다. 또한, VLA 모델의 데이터셋, 시뮬레이터, 벤치마크 등 관련 리소스를 종합적으로 정리하고 미래 연구 방향을 제안합니다.
관련 컴퓨터 과학 논문
의료 영상 비전-언어 파운데이션 모델
2025·41
확산 모델 기반 이미지 증강 기술 동향
2025·48
거대 언어 모델 안전성 확보 방안
2025·51
금융 설명 가능한 AI 종합 분석
2025·76