Caramel LabCaramel Lab
#

체화인공지능

1의 한국어 분석 — 최신순으로 정렬했어요

컴퓨터 과학발표 2026.04· 15최근 1년 13

체화 인공지능을 위한 시각-언어-행동 모델 연구

체화 인공지능(Embodied AI)은 물리적 세계에서 로봇이 작업을 수행하도록 제어하는 것을 포함하기에 인공 일반 지능(AGI)의 핵심 요소로 주목받고 있습니다. 최근 대규모 언어 모델(LLM)과 시각-언어 모델(VLM)의 성공을 기반으로, 언어 조건부 로봇 작업을 처리하고 행동을 생성하는 시각-언어-행동(VLA) 모델이 새로운 다중 모드 모델로 부상했습니다. 이처럼 빠르게 발전하는 VLA 모델 분야를 체계적으로 정리하기 위한 포괄적인 연구의 필요성이 증대되고 있습니다. 본 연구는 체화 인공지능을 위한 VLA 모델에 대한 최초의 종합적인 조사를 제시합니다. VLA 모델을 세 가지 주요 연구 분야로 분류하여 상세한 분류 체계를 제공합니다. 첫 번째는 VLA의 개별 구성 요소에 중점을 두며, 두 번째는 저수준 행동 예측에 능숙한 VLA 기반 제어 정책 개발에 전념합니다. 세 번째는 장기 작업을 하위 작업으로 분해하여 VLA가 더 일반적인 사용자 지침을 따르도록 안내하는 고수준 작업 계획자로 구성됩니다. 또한, 데이터셋, 시뮬레이터, 벤치마크 등 관련 리소스에 대한 광범위한 요약을 제공합니다. 마지막으로 VLA 모델이 직면한 과제를 논의하고 체화 인공지능 분야의 유망한 미래 방향을 제시합니다. 이 연구와 관련된 자료는 GitHub 저장소(https://github.com/yueen-ma/Awesome-VLA)에서 확인할 수 있습니다.

연구 트렌드로 돌아가기