Caramel LabCaramel Lab
#

랜덤포레스트

2편의 한국어 분석 — 최신순으로 정렬했어요

생물학발표 2026.08· 0

약용 식물 다당류의 항산화 관계 규명

산화 스트레스는 다양한 질병의 병인에 기여하며, 약용 식물 다당류(MPPs)는 유망한 천연 항산화제입니다. 그러나 MPPs의 상당한 구조적 이질성으로 인해 신뢰할 수 있는 구조-활성 관계(SAR)를 확립하기 어려워 합리적인 선별 및 개발에 한계가 있습니다. 본 연구는 MPPs의 항산화 활성을 예측하기 위한 다중 알고리즘 데이터 기반 정량적 구조-활성 관계(QSAR) 프레임워크를 구축하는 것을 목표로 했습니다. 문헌 기반 데이터셋을 수집, 표준화 및 통합하여 다당류 분자량(MW)과 항산화 활성 간의 관계를 다중 선형 회귀(MLR), K-평균 군집화 및 주성분 분석(PCA)으로 분석했습니다. 단당류 조성과 항산화 활성 간의 관계는 그래디언트 부스팅 결정 트리 회귀, 서포트 벡터 회귀, 랜덤 포레스트(RF)를 사용하여 모델링했습니다. MLR은 MW와 라디칼 소거 활성 사이에 명확한 선형 관계가 없음을 보여주었으며, 이는 비선형적이거나 여러 구조적 요인에 의해 좌우될 수 있음을 시사합니다. 군집 분석은 뚜렷한 MW 관련 분포 패턴을 나타냈으나, 항산화 활성은 MW 특성이 다른 다당류 간에 광범위하게 변화했습니다. 단당류 조성 모델링에서는 RF가 가장 우수한 성능을 보였고, 특징 중요도 및 SHAP 분석을 통해 DPPH· 및 ·OH 소거 활성과 관련된 여러 단당류가 식별되었습니다. 이러한 모델 기반 관계는 10개의 구조적으로 다양한 다당류와 8개의 독립적인 판람근 다당류 배치에 대한 외부 검증을 통해 지지되었습니다. 대표적인 다당류는 H2O2 유도 제브라피쉬 산화 스트레스 모델에서 추가로 평가되었으며, 관찰된 항산화 효과는 모델 예측을 보완했습니다. 본 연구는 MPPs의 구조-항산화 관계를 이해하고 합리적인 개발을 위한 강력한 도구를 제공합니다.

컴퓨터 과학발표 2025.11· 21최근 1년 21회

얕은 의사결정나무로 랜덤 포레스트 및 XGBoost 설명

기계 학습 모델의 투명성은 해석 가능한 모델과 설명 가능한 결과를 촉진하는 중요한 비기능적 요구사항입니다. 그러나 선형, 규칙 기반, 의사결정나무와 같은 해석 가능한 분류 모델은 딥러닝이나 앙상블 방법론과 같은 더 정확하지만 복잡한 학습 패러다임에 의해 성능이 저해되는 경향이 있습니다. 특히 표 형식 데이터 분류에서는 랜덤 포레스트나 XGBoost 같은 트리 앙상블 기반 모델이 딥러닝 모델과 비교하여 여전히 경쟁력이 있으며 종종 선호되지만, 학습된 모델의 복잡성으로 인해 예측 설명 가능성 문제가 발생합니다. 기존 해결책은 특성 중요도 점수를 계산하거나 학습된 트리 앙상블에서 근사 대체 모델을 추출하는 방식이었으나, 이는 충실도가 낮거나 이해하기 어려운 대체 모델로 이어지는 한계가 있었습니다. 본 연구에서는 이러한 절충점을 개선하기 위해 Goodman-Kruskal의 연관성 측도를 활용하여 공유 특성 그룹으로 설명되는 예측을 가진 인스턴스 그룹을 찾습니다. 이 구조를 구축하기 위해 먼저 SHAP 값으로 인스턴스를 설명하여 지역 특성 중요도를 포착한 다음, 이 SHAP 값을 기반으로 특성과 함께 공동 군집화합니다. 이후, 각 인스턴스 그룹과 관련 특성 부분집합에 대해 학습된 얕은 의사결정나무 집합으로 대체 모델을 구축합니다. 실험 결과, 본 연구의 방법론은 최신 경쟁 방법론과 비교하여 경쟁력 있는 충실도와 더 높은 이해도를 가진 대체 모델을 생성하여 랜덤 포레스트 및 XGBoost 분류기를 효과적으로 설명함을 보여주었습니다. 본 연구는 복잡한 앙상블 모델의 설명 가능성을 향상시키는 새로운 접근 방식을 제시하며, 이를 통해 기계 학습 모델의 투명성을 높이고 실용적인 적용에 기여할 수 있을 것으로 기대됩니다.

연구 트렌드로 돌아가기