의료 조언 LLM의 프롬프트 주입 취약성
Vulnerability of Large Language Models to Prompt Injection When Providing Medical Advice
Ro Woon Lee, Tae Joon Jun, Jeong-Moo Lee 외 3인·JAMA Network Open·발표 2025.12· 21 인용
최근 1년 21회 인용· 떠오르는 연구
한국어 핵심 요약
대규모 언어 모델(LLM)이 헬스케어 분야에 통합되고 있으나, 악의적인 프롬프트 주입 공격에 대한 체계적인 평가가 부족했습니다. 본 연구는 상용 LLM이 안전하지 않은 의료 조언을 유도할 수 있는 프롬프트 주입 공격에 얼마나 취약한지 평가하고, 중간자(man-in-the-middle) 및 클라이언트 측 주입이 현실적인 공격 벡터임을 검증하는 것을 목표로 합니다.
2025년 1월부터 10월까지 표준화된 환자-LLM 대화를 사용한 시뮬레이션 연구를 수행했습니다. GPT-4o-mini, Gemini-2.0-flash-lite, Claude-3-haiku 등 3가지 경량 모델을 보충제 추천, 아편유사제 처방, 임신 금기, 중추신경계 독성 등 4가지 범주의 12개 임상 시나리오에서 평가했습니다. 또한, GPT-5, Gemini 2.5 Pro, Claude 4.5 Sonnet 등 3가지 플래그십 모델을 고위험 임신 시나리오에서 클라이언트 측 주입 방식으로 테스트했습니다. 공격 전략으로는 맥락 인식 주입과 증거 조작 주입을 사용했습니다.
총 216회 평가(주입 108회, 대조군 108회) 중, 공격은 4번째 대화 턴에서 94.4%(108회 중 102회)의 성공률을 보였고, 후속 대화에서 69.4%(108회 중 75회) 지속되었습니다. 이는 LLM이 의료 조언 제공 시 심각한 보안 취약성을 가질 수 있음을 시사합니다.
본 연구는 의료 분야 LLM의 보안 취약성을 밝혀내고, 안전한 의료 AI 시스템 개발을 위한 중요한 기초 자료를 제공합니다. 향후 LLM 기반 의료 애플리케이션 설계 시 프롬프트 주입 방어 메커니즘을 강화하는 데 기여할 것입니다.
섹션 미리보기
연구 배경
헬스케어 분야에 LLM 도입이 늘고 있지만, 악의적인 프롬프트 주입 공격으로 의료 권고가 변질될 수 있다는 점은 체계적으로 평가되지 않았습니다. 본 연구는 상용 LLM의 프롬프트 주입 취약성을 평가하고 현실적인 공격 벡터를 검증하고자 합니다.
핵심 발견
주입 공격은 4번째 대화 턴에서 94.4%의 높은 성공률을 보였고, 69.4%의 후속 대화에서 지속되었습니다. 이는 LLM이 의료 조언 제공 시 프롬프트 주입에 매우 취약하며, 심각한 보안 위험을 내포하고 있음을 시사합니다.
관련 컴퓨터 과학 논문
해양 공간 데이터 인프라와 오픈 사이언스 연계
2026·0
ML 기반 대규모 이종 음악-교통 데이터 분석
2026·0
AI 생성 대화의 자연스러움: 턴 주고받기 및 역할 행동 분석
2026·0
분산 마이크 쌍 선택 기반 음원 위치 추정
2026·0