Caramel LabCaramel Lab

의료 조언 LLM의 프롬프트 주입 취약성

Vulnerability of Large Language Models to Prompt Injection When Providing Medical Advice

Ro Woon Lee, Tae Joon Jun, Jeong-Moo Lee 외 3인·JAMA Network Open·발표 2025.12· 21 인용
최근 1년 21회 인용· 떠오르는 연구

한국어 핵심 요약

대규모 언어 모델(LLM)이 헬스케어 분야에 통합되고 있으나, 악의적인 프롬프트 주입 공격에 대한 체계적인 평가가 부족했습니다. 본 연구는 상용 LLM이 안전하지 않은 의료 조언을 유도할 수 있는 프롬프트 주입 공격에 얼마나 취약한지 평가하고, 중간자(man-in-the-middle) 및 클라이언트 측 주입이 현실적인 공격 벡터임을 검증하는 것을 목표로 합니다. 2025년 1월부터 10월까지 표준화된 환자-LLM 대화를 사용한 시뮬레이션 연구를 수행했습니다. GPT-4o-mini, Gemini-2.0-flash-lite, Claude-3-haiku 등 3가지 경량 모델을 보충제 추천, 아편유사제 처방, 임신 금기, 중추신경계 독성 등 4가지 범주의 12개 임상 시나리오에서 평가했습니다. 또한, GPT-5, Gemini 2.5 Pro, Claude 4.5 Sonnet 등 3가지 플래그십 모델을 고위험 임신 시나리오에서 클라이언트 측 주입 방식으로 테스트했습니다. 공격 전략으로는 맥락 인식 주입과 증거 조작 주입을 사용했습니다. 총 216회 평가(주입 108회, 대조군 108회) 중, 공격은 4번째 대화 턴에서 94.4%(108회 중 102회)의 성공률을 보였고, 후속 대화에서 69.4%(108회 중 75회) 지속되었습니다. 이는 LLM이 의료 조언 제공 시 심각한 보안 취약성을 가질 수 있음을 시사합니다. 본 연구는 의료 분야 LLM의 보안 취약성을 밝혀내고, 안전한 의료 AI 시스템 개발을 위한 중요한 기초 자료를 제공합니다. 향후 LLM 기반 의료 애플리케이션 설계 시 프롬프트 주입 방어 메커니즘을 강화하는 데 기여할 것입니다.

섹션 미리보기

연구 배경

헬스케어 분야에 LLM 도입이 늘고 있지만, 악의적인 프롬프트 주입 공격으로 의료 권고가 변질될 수 있다는 점은 체계적으로 평가되지 않았습니다. 본 연구는 상용 LLM의 프롬프트 주입 취약성을 평가하고 현실적인 공격 벡터를 검증하고자 합니다.

핵심 발견

주입 공격은 4번째 대화 턴에서 94.4%의 높은 성공률을 보였고, 69.4%의 후속 대화에서 지속되었습니다. 이는 LLM이 의료 조언 제공 시 프롬프트 주입에 매우 취약하며, 심각한 보안 위험을 내포하고 있음을 시사합니다.

전체 8개 섹션 분석

내가 읽고 있는 논문도 이렇게 정리해드릴게요

연구 배경 · 방법론 · 결과 · 한계점까지 8개 섹션 풀 분석. PDF 업로드 한 번이면 끝.

내 논문 분석하기

관련 컴퓨터 과학 논문

컴퓨터 과학 전체 보기