의료 조언 LLM의 프롬프트 주입 취약성
Vulnerability of Large Language Models to Prompt Injection When Providing Medical Advice
Ro Woon Lee, Tae Joon Jun, Jeong-Moo Lee 외 3인·JAMA Network Open·발표 2025.12· 21 인용
최근 1년 21회 인용· 떠오르는 연구
한국어 핵심 요약
대규모 언어 모델(LLM)이 헬스케어 분야에 통합되고 있으나, 악의적인 프롬프트 주입 공격에 대한 체계적인 평가가 부족했습니다. 본 연구는 상용 LLM이 안전하지 않은 의료 조언을 유도할 수 있는 프롬프트 주입 공격에 얼마나 취약한지 평가하고, 중간자(man-in-the-middle) 및 클라이언트 측 주입이 현실적인 공격 벡터임을 검증하는 것을 목표로 합니다.
2025년 1월부터 10월까지 표준화된 환자-LLM 대화를 사용한 시뮬레이션 연구를 수행했습니다. GPT-4o-mini, Gemini-2.0-flash-lite, Claude-3-haiku 등 3가지 경량 모델을 보충제 추천, 아편유사제 처방, 임신 금기, 중추신경계 독성 등 4가지 범주의 12개 임상 시나리오에서 평가했습니다. 또한, GPT-5, Gemini 2.5 Pro, Claude 4.5 Sonnet 등 3가지 플래그십 모델을 고위험 임신 시나리오에서 클라이언트 측 주입 방식으로 테스트했습니다. 공격 전략으로는 맥락 인식 주입과 증거 조작 주입을 사용했습니다.
총 216회 평가(주입 108회, 대조군 108회) 중, 공격은 4번째 대화 턴에서 94.4%(108회 중 102회)의 성공률을 보였고, 후속 대화에서 69.4%(108회 중 75회) 지속되었습니다. 이는 LLM이 의료 조언 제공 시 심각한 보안 취약성을 가질 수 있음을 시사합니다.
본 연구는 의료 분야 LLM의 보안 취약성을 밝혀내고, 안전한 의료 AI 시스템 개발을 위한 중요한 기초 자료를 제공합니다. 향후 LLM 기반 의료 애플리케이션 설계 시 프롬프트 주입 방어 메커니즘을 강화하는 데 기여할 것입니다.
섹션 미리보기
연구 배경
헬스케어 분야에 LLM 도입이 늘고 있지만, 악의적인 프롬프트 주입 공격으로 의료 권고가 변질될 수 있다는 점은 체계적으로 평가되지 않았습니다. 본 연구는 상용 LLM의 프롬프트 주입 취약성을 평가하고 현실적인 공격 벡터를 검증하고자 합니다.
핵심 발견
주입 공격은 4번째 대화 턴에서 94.4%의 높은 성공률을 보였고, 69.4%의 후속 대화에서 지속되었습니다. 이는 LLM이 의료 조언 제공 시 프롬프트 주입에 매우 취약하며, 심각한 보안 위험을 내포하고 있음을 시사합니다.
관련 컴퓨터 과학 논문
다중 데이터 양식 AI 생성 콘텐츠 연구
2025·39
대형 컨볼루션 커널 기반 범용 표현 학습
2025·18
생성형 AI 기반 자율형 장애 복구 시스템
2025·20
LLM 프롬프트 주입 공격 종합 분석
2026·20