독성 예측 벤치마크: 누출 감사 및 불확실성 분석
ToxBench: a leakage-audited multi-task benchmark for predictive toxicology with calibration, uncertainty, and applicability domain analysis
Kartic, Yeeun Seo, Sanggyun Yi 외 1인·BMC Bioinformatics·발표 2026.09· 0 인용
한국어 핵심 요약
독성 예측 머신러닝 모델은 무작위 분할로 인해 과대평가된 성능을 보고하는 경향이 있습니다. 이는 구조적으로 유사한 화합물이 훈련 및 테스트 세트에 동시에 나타나기 때문입니다. 본 연구는 이러한 과대평가를 정량화하고, 모델의 보정(calibration), 불확실성(uncertainty), 적용 영역(applicability domain) 분석을 통합한 엄격한 벤치마크의 필요성을 제기합니다.
저자들은 누출 감사(leakage-audited) 벤치마크인 ToxBench를 제안합니다. 이는 Tox21, ClinTox, SIDER 세 가지 독성 데이터셋을 포함하며, 투명한 표준화 파이프라인을 통해 처리되었습니다. Random Forest, XGBoost, MLP, GNN 네 가지 모델 클래스를 무작위 및 Bemis-Murcko 스캐폴드 기반 분할 방식으로 평가했습니다. 분석에는 사후 확률 보정, 앙상블 기반 불확실성 정량화, 최근접 이웃 적용 영역 분석 및 스캐폴드 수준 오류 분석이 포함되었습니다.
스캐폴드 분할은 Tox21에서 AUROC를 평균 0.070점, SIDER에서 0.031–0.035점 감소시켜, 무작위 분할 시 성능이 체계적으로 과대평가됨을 입증했습니다. ClinTox는 작은 데이터셋 크기와 심한 클래스 불균형으로 인해 샘플링 노이즈가 결과에 지배적인 영향을 미쳤습니다. 사후 보정은 ClinTox에서 ECE를 67–68% 감소시켜, 간단한 보정으로 신뢰할 수 있는 확률 추정이 가능함을 확인했습니다.
본 연구는 독성 예측 모델의 신뢰성과 유효성을 높이는 데 기여하며, 실제 적용 시 모델 선택 및 해석에 중요한 지침을 제공합니다. ToxBench는 향후 독성 예측 모델 개발 및 평가의 표준으로 활용될 수 있습니다.
섹션 미리보기
연구 배경
기존 독성 예측 모델 평가는 무작위 데이터 분할로 인해 구조적으로 유사한 화합물이 훈련/테스트 세트에 중복되어 성능이 과대평가되는 문제가 있습니다. 이러한 과대평가를 정량화하고 모델의 신뢰성을 높이기 위한 엄격한 벤치마크가 필요합니다.
핵심 발견
스캐폴드 기반 데이터 분할은 무작위 분할 대비 AUROC를 최대 0.079점 감소시켜 성능 과대평가를 명확히 입증했습니다. 사후 확률 보정은 특정 데이터셋에서 예측 신뢰도를 크게 향상시켰습니다. ToxBench는 독성 예측 모델의 신뢰성 있는 평가를 위한 새로운 기준을 제시합니다.
관련 컴퓨터 과학 논문
부분 관측 다중 모드 헬스케어 예측을 위한 차등 프라이빗 연합 학습
2026·0
미주신경성 실신 탐지: 프라이버시 보호 ML
2026·0
AI 생성 대화의 자연스러움: 턴 주고받기 및 역할 행동 분석
2026·0
해양 공간 데이터 인프라와 오픈 사이언스 연계
2026·0