장문 맥락 확산 언어 모델 추론 가속화
SW-SpeedDLM: Sliding Window Speculative Decoding for Diffusion Language Models Under Long Context Constraints
마스크 확산 언어 모델(MDLM)은 모든 디노이징 단계에서 양방향 어텐션을 사용하며, 이는 단계 수 T와 시퀀스 길이 n에 대해 O(Tn^2)의 높은 연산 비용을 발생시킵니다. 특히, 80억 매개변수 모델에서 n=8192, T=128일 경우 KV 캐시만 40GB를 초과하여 단일 GPU로는 긴 문서 생성이 어렵습니다. 본 연구는 이러한 한계를 극복하기 위해 사전 학습된 MDLM의 추론 래퍼인 SW-SpeedDLM을 제안합니다. SW-SpeedDLM은 세 가지 핵심 구성 요소로 이루어져 있습니다. 첫째, 분할 슬라이딩 윈도우 디노이징…