엣지-클라우드 협업 LLM 추론 및 학습
거대 언어 모델(LLM)의 발전에도 불구하고, 클라우드 단독 배포나 엣지 기기 압축은 지연 시간, 개인 정보 보호, 비용, 개인화 문제로 인해 한계에 부딪히고 있습니다. 본 연구는 클라우드 LLM과 엣지 소형 언어 모델(SLM)이 추론 및 학습 과정에서 협력하는 패러다임을 탐구합니다. 이를 위해 엣지-클라우드 협업 전략에 대한 통합 분류 체계를 제안합니다. 추론 단계에서는 작업 할당, 작업 분할, 혼합 기반 협업 방식을 작업 및 토큰 수준으로 분류하며, 적응형 스케줄링, 자원 인식 오프로딩, 추측 디코딩, 모듈러 라우팅 등을 포함합니다. 학습 단계에서는 파라미터 정렬, 가지치기, 양방향 증류, 소형 모델 기반 최적화 등 분산 적응 기술을 검토합니다. 나아가 데이터셋, 벤치마크, 배포 사례를 요약하고, 개인 정보 보호 기술과 수직적 응용 분야를 조명합니다. 이 연구는 LLM-SLM 협업을 위한 체계적인 기반을 구축하고, 효율적이고 확장 가능하며 신뢰할 수 있는 엣지-클라우드 인텔리전스를 위한 시스템-알고리즘 공동 설계를 연결하는 것을 목표로 합니다.