Caramel LabCaramel Lab
#

추론최적화

1의 한국어 분석 — 최신순으로 정렬했어요

컴퓨터 과학발표 2026.08· 0

LLM 추론 처리량 증대를 위한 멀티-빈 배치

대규모 언어 모델(LLM)의 활용이 증가함에 따라, 추론 시스템의 효율성 개선이 중요해지고 있습니다. 서버(예: GPU)에서 추론 작업을 스케줄링할 때 배치(batching)는 여러 요청을 병렬로 처리하여 처리량을 극대화하는 핵심 단계입니다. 그러나 요청별 생성 길이의 편차가 커서 하드웨어 자원 활용도가 저하되는 문제가 발생합니다. 이는 배치 내 가장 긴 요청이 완료될 때까지 다음 배치를 처리할 수 없기 때문입니다. 본 연구는 이러한 문제를 큐잉 이론 관점에서 정형화하고, 정적 배치(static-batching) 프레임워크 내에서 처리량 최적의 제어 정책을 설계하는 것을 목표로 합니다. 이를 위해 유사한 (예측) 실행 시간을 가진 요청들을 미리 정해진 여러 개의 빈(bin)으로 그룹화하는 간단하면서도 효과적인 방법인 멀티-빈 배치(Multi-Bin Batching)를 제안합니다. 이 방법은 정적 배치 프레임워크에서 LLM 추론 처리량을 향상시킬 수 있음을 이론적으로 증명합니다. 실제 LLM 추론 시나리오에서 정적 및 연속 배치(continuous-batching) 기준선과의 비교 실험을 통해, 멀티-빈 배치가 정적 배치 대비 처리량을 크게 개선함을 입증했습니다. 또한, 오라클 및 예측 길이 정보 하에서 네이티브 연속 배치와의 잔여 성능 격차를 정량화했습니다. 이 연구는 LLM 추론 시스템의 효율성을 높여 자원 활용도를 극대화하고, 실제 서비스 환경에서의 LLM 성능 향상에 기여할 수 있습니다.

연구 트렌드로 돌아가기