단일-다중 에이전트 강화 학습: 이론과 응용
Reinforcement learning for single-agent to multi-agent systems: from basic theory to industrial application progress, a survey
Dehua Zhang, Qing‐Song Yuan, Lei Meng 외 3인·Artificial Intelligence Review·발표 2025.11· 63 인용
최근 1년 63회 인용· 떠오르는 연구
한국어 핵심 요약
인공지능과 제어 과학이 융합된 강화 학습(RL)은 최적 제어 분야의 핵심 연구 주제로 부상하고 있습니다. 본 논문은 RL의 발전 맥락을 체계적으로 검토하며, 특히 단일 에이전트 강화 학습(SARL)과 다중 에이전트 강화 학습(MARL) 간의 본질적인 연관성에 주목합니다.
연구는 RL의 형성 및 발전 과정부터 시작하여, 다른 기계 학습 패러다임과의 유사점 및 차이점을 설명하고 주요 분야를 소개합니다. SARL의 기본 지식과 핵심 아이디어를 바탕으로 다중 에이전트 시스템(MAS)의 협업 제어로 확장하여, 이론적 프레임워크와 알고리즘 설계에서 두 방법론의 일관된 특성을 탐구합니다.
이를 통해 SARL 알고리즘을 동적 계획법, 가치 함수 분해, 정책 경사(PG) 유형으로 재구성하고, MARL 알고리즘을 행동 분석, 중앙 집중식 학습, 통신 학습, 협업 학습의 네 가지 패러다임으로 추상화합니다. 이 과정에서 단일 에이전트에서 다중 에이전트 시나리오로의 알고리즘 매핑 관계를 수립합니다. 이 혁신적인 프레임워크는 두 방법론의 진화적 상관관계를 이해하는 새로운 관점을 제공하며, 대규모 MAS 문제 해결에서 MARL의 도전 과제와 해결 방안을 논의합니다.
본 연구는 관련 분야 연구자들에게 중요한 참고 자료를 제공하고, MAS의 협업 제어 및 최적화 방법론 개발과 관련 응용 연구 발전에 기여하는 것을 목표로 합니다.
섹션 미리보기
연구 배경
강화 학습(RL)은 인공지능과 제어 과학의 융합 분야로, 최적 제어 분야에서 핵심 연구 주제로 부상했습니다. 본 연구는 RL의 발전 맥락을 체계적으로 검토하며, 특히 단일 에이전트 강화 학습(SARL)과 다중 에이전트 강화 학습(MARL) 간의 본질적인 연관성에 주목합니다.
핵심 발견
SARL 알고리즘을 동적 계획법, 가치 함수 분해, 정책 경사 유형으로 재구성하고, MARL 알고리즘을 네 가지 패러다임으로 추상화하여 단일-다중 에이전트 시나리오 간의 알고리즘 매핑 관계를 수립했습니다. 이 프레임워크는 두 방법론의 진화적 상관관계를 이해하는 새로운 관점을 제공합니다.
관련 컴퓨터 과학 논문
부분 관측 다중 모드 헬스케어 예측을 위한 차등 프라이빗 연합 학습
2026·0
미주신경성 실신 탐지: 프라이버시 보호 ML
2026·0
AI 생성 대화의 자연스러움: 턴 주고받기 및 역할 행동 분석
2026·0
해양 공간 데이터 인프라와 오픈 사이언스 연계
2026·0