Caramel LabCaramel Lab
#

독성 예측

1의 한국어 분석 — 최신순으로 정렬했어요

컴퓨터 과학발표 2026.09· 0

독성 예측 벤치마크: 누출 감사 및 불확실성 분석

독성 예측 머신러닝 모델은 무작위 분할로 인해 과대평가된 성능을 보고하는 경향이 있습니다. 이는 구조적으로 유사한 화합물이 훈련 및 테스트 세트에 동시에 나타나기 때문입니다. 본 연구는 이러한 과대평가를 정량화하고, 모델의 보정(calibration), 불확실성(uncertainty), 적용 영역(applicability domain) 분석을 통합한 엄격한 벤치마크의 필요성을 제기합니다. 저자들은 누출 감사(leakage-audited) 벤치마크인 ToxBench를 제안합니다. 이는 Tox21, ClinTox, SIDER 세 가지 독성 데이터셋을 포함하며, 투명한 표준화 파이프라인을 통해 처리되었습니다. Random Forest, XGBoost, MLP, GNN 네 가지 모델 클래스를 무작위 및 Bemis-Murcko 스캐폴드 기반 분할 방식으로 평가했습니다. 분석에는 사후 확률 보정, 앙상블 기반 불확실성 정량화, 최근접 이웃 적용 영역 분석 및 스캐폴드 수준 오류 분석이 포함되었습니다. 스캐폴드 분할은 Tox21에서 AUROC를 평균 0.070점, SIDER에서 0.031–0.035점 감소시켜, 무작위 분할 시 성능이 체계적으로 과대평가됨을 입증했습니다. ClinTox는 작은 데이터셋 크기와 심한 클래스 불균형으로 인해 샘플링 노이즈가 결과에 지배적인 영향을 미쳤습니다. 사후 보정은 ClinTox에서 ECE를 67–68% 감소시켜, 간단한 보정으로 신뢰할 수 있는 확률 추정이 가능함을 확인했습니다. 본 연구는 독성 예측 모델의 신뢰성과 유효성을 높이는 데 기여하며, 실제 적용 시 모델 선택 및 해석에 중요한 지침을 제공합니다. ToxBench는 향후 독성 예측 모델 개발 및 평가의 표준으로 활용될 수 있습니다.

연구 트렌드로 돌아가기