LLM 프롬프트 주입 공격 종합 분석
Prompt Injection Attacks in Large Language Models and AI Agent Systems: A Comprehensive Review of Vulnerabilities, Attack Vectors, and Defense Mechanisms
Saidakhror Gulyamov, Saidakhror Gulyamov, Said Saidakhrarovich Gulyamov 외 5인·Information·발표 2026.01· 20 인용
최근 1년 20회 인용· 떠오르는 연구
한국어 핵심 요약
대규모 언어 모델(LLM)은 인공지능 응용 분야를 혁신했지만, 실제 시스템 통합 과정에서 프롬프트 주입 공격이라는 심각한 보안 취약점을 드러냈습니다. 본 연구는 2023년부터 2025년까지의 연구 45건, 산업 보안 보고서, 실제 공격 사례를 종합적으로 분석하여 이 문제를 다룹니다.
직접적인 탈옥(jailbreaking)과 외부 콘텐츠를 통한 간접 주입을 포함한 프롬프트 주입 기술의 분류 체계를 검토했습니다. AI 에이전트 시스템과 모델 컨텍스트 프로토콜(MCP)의 등장은 공격 표면을 크게 확장하여 도구 오염 및 자격 증명 탈취와 같은 새로운 취약점을 야기했습니다.
주요 사건으로는 GitHub Copilot의 CVE-2025-53773 원격 코드 실행 취약점(CVSS 9.6)과 ChatGPT의 Windows 라이선스 키 노출 사례를 기록했습니다. 연구 결과, 단 5개의 정교하게 제작된 문서만으로도 검색 증강 생성(RAG) 오염을 통해 AI 응답의 90%를 조작할 수 있음이 입증되었습니다.
본 연구는 5가지 보호 계층을 구현하는 심층 방어 프레임워크인 PALADIN을 제안하며, OWASP Top 10 for LLM Applications 2025를 기반으로 한 실행 가능한 완화 전략을 제시합니다. 프롬프트 주입은 단일 솔루션이 아닌 심층 방어 접근 방식이 필요한 근본적인 아키텍처 취약점임을 밝히고, 확률적 특성 문제 및 정렬 역설과 같은 근본적인 한계를 식별하며, 아키텍처적으로 안전한 AI 시스템을 위한 연구 방향을 제시합니다.
섹션 미리보기
연구 배경
LLM은 AI 응용 분야를 혁신했지만, 실제 시스템에 통합되면서 프롬프트 주입 공격이라는 심각한 보안 취약점이 부각되었습니다. 이 공격은 LLM의 신뢰성과 안전성을 위협하며, 광범위한 산업에 걸쳐 중요한 문제를 야기합니다.
핵심 발견
AI 에이전트 시스템과 MCP의 등장은 공격 표면을 확장하여 도구 오염 및 자격 증명 탈취와 같은 취약점을 유발합니다. 단 5개의 문서로 RAG 오염을 통해 AI 응답의 90%를 조작할 수 있으며, 프롬프트 주입은 심층 방어가 필요한 근본적인 아키텍처 취약점입니다.
관련 컴퓨터 과학 논문
다중 데이터 양식 AI 생성 콘텐츠 연구
2025·39
의료 조언 LLM의 프롬프트 주입 취약성
2025·21
대형 컨볼루션 커널 기반 범용 표현 학습
2025·18
생성형 AI 기반 자율형 장애 복구 시스템
2025·20