LLM 추론 처리량 증대를 위한 멀티-빈 배치
Multi-Bin Batching for Increasing LLM Inference Throughput
Ozgur Guldogan, Jackson Kunde, Kangwook Lee 외 1인·ACM Transactions on Modeling and Performance Evaluation of Computing Systems·발표 2026.08· 0 인용
한국어 핵심 요약
대규모 언어 모델(LLM)의 활용이 증가함에 따라, 추론 시스템의 효율성 개선이 중요해지고 있습니다. 서버(예: GPU)에서 추론 작업을 스케줄링할 때 배치(batching)는 여러 요청을 병렬로 처리하여 처리량을 극대화하는 핵심 단계입니다. 그러나 요청별 생성 길이의 편차가 커서 하드웨어 자원 활용도가 저하되는 문제가 발생합니다. 이는 배치 내 가장 긴 요청이 완료될 때까지 다음 배치를 처리할 수 없기 때문입니다.
본 연구는 이러한 문제를 큐잉 이론 관점에서 정형화하고, 정적 배치(static-batching) 프레임워크 내에서 처리량 최적의 제어 정책을 설계하는 것을 목표로 합니다. 이를 위해 유사한 (예측) 실행 시간을 가진 요청들을 미리 정해진 여러 개의 빈(bin)으로 그룹화하는 간단하면서도 효과적인 방법인 멀티-빈 배치(Multi-Bin Batching)를 제안합니다.
이 방법은 정적 배치 프레임워크에서 LLM 추론 처리량을 향상시킬 수 있음을 이론적으로 증명합니다. 실제 LLM 추론 시나리오에서 정적 및 연속 배치(continuous-batching) 기준선과의 비교 실험을 통해, 멀티-빈 배치가 정적 배치 대비 처리량을 크게 개선함을 입증했습니다.
또한, 오라클 및 예측 길이 정보 하에서 네이티브 연속 배치와의 잔여 성능 격차를 정량화했습니다. 이 연구는 LLM 추론 시스템의 효율성을 높여 자원 활용도를 극대화하고, 실제 서비스 환경에서의 LLM 성능 향상에 기여할 수 있습니다.
섹션 미리보기
연구 배경
LLM 추론 시스템의 효율성 개선은 핵심 과제입니다. 기존 배치 처리 방식은 요청별 생성 길이 편차로 인해 자원 활용도가 낮아지고, 이는 전체 처리량 저하로 이어집니다.
핵심 발견
멀티-빈 배치는 유사한 실행 시간의 요청을 그룹화하여 LLM 추론 처리량을 크게 개선합니다. 이론적 분석과 실제 실험을 통해 정적 배치 대비 우수성을 입증했습니다.
관련 컴퓨터 과학 논문
부분 관측 다중 모드 헬스케어 예측을 위한 차등 프라이빗 연합 학습
2026·0
미주신경성 실신 탐지: 프라이버시 보호 ML
2026·0
AI 생성 대화의 자연스러움: 턴 주고받기 및 역할 행동 분석
2026·0
해양 공간 데이터 인프라와 오픈 사이언스 연계
2026·0