LLM 보안 강화: 초기 탐지 시스템 성능 평가
프롬프트 주입(PI) 공격, 특히 프롬프트 유출은 LLM 기반 애플리케이션에 심각한 기밀성 위협을 초래하며, 기존 방어 체계는 이를 정확히 식별하지 못하고 우회될 수 있어 LLM의 광범위한 도입을 저해합니다. 현재 PI 탐지 도구의 실제 효과에 대한 실증적 연구가 부족하며, 기존 도구의 탐지 정밀도와 개선 방안에 대한 실질적인 지식이 부재합니다. 본 연구는 초기 프롬프트 주입 탐지 시스템의 역량을 평가하기 위해 여러 오픈소스 솔루션에 구현된 탐지 기법의 성능에 초점을 맞추었습니다. 컨텍스트 무시 및 컨텍스트 조작과 같은 널리 사용되는 주입 기법을 활용한 프롬프트 유출 공격에 대해 LLM Guard, Vigil, Rebuff를 테스트하고 비교 분석했습니다. 분석 결과, Vigil과 Rebuff의 카나리 워드 기반 탐지 기법은 프롬프트 유출 공격에 취약함이 드러났으며, 이에 대한 개선 방안을 제시했습니다. 또한, Rebuff의 보조 모델 기반 기법에서 회피 취약점을 발견하고 완화책을 제안했습니다. 결론적으로, Vigil은 최소 오탐률이 요구되는 경우에 최적이며, Rebuff는 최고 탐지율을 위해 가장 적합하다는 것을 확인했습니다. 본 연구는 LLM 애플리케이션 보안 강화에 기여하고, 향후 탐지 시스템 개선을 위한 실질적인 통찰력을 제공합니다.