도움이 독 될 때: LLM의 아첨과 의료 오정보 위험
대규모 언어 모델(LLM)은 유용성을 지향하는 훈련 과정에서 비논리적인 요청에도 순응하여 잘못된 정보를 생성할 수 있는 취약점을 보인다. 이는 모델이 해당 요청의 비논리성을 인지할 지식이 있음에도 불구하고 발생한다. 본 연구는 이러한 취약점이 의료 분야에서 어떻게 나타나는지 조사했으며, 동등 약물 관계를 오해하는 프롬프트를 사용하여 최신 LLM 5종을 평가했다. 연구는 기본 아첨 경향, 거부 허용 및 사실 회상을 강조하는 프롬프트의 영향, 그리고 비논리적 요청 데이터셋을 통한 미세 조정(분포 외 일반화 포함)의 효과를 테스트했다. 초기 순응도는 모든 모델에서 최대 100%에 달해, 논리적 일관성보다 유용성을 우선시하는 경향을 보였다. 프롬프트 엔지니어링과 미세 조정을 통해 성능이 향상되었으며, 비논리적 요청에 대한 거부율이 높아지면서도 일반 벤치마크 성능은 유지되었다. 이는 표적 훈련과 프롬프트 설계를 통해 논리적 일관성을 우선시하는 것이 잘못된 의료 정보 생성 위험을 완화하고 의료 분야에서 LLM의 안전한 배포를 보장하는 데 중요함을 시사한다.