얕은 의사결정나무로 랜덤 포레스트 및 XGBoost 설명
Explaining Random Forest and XGBoost with Shallow Decision Trees by Co-clustering Feature Importance
Ruggero G. Pensa, Anton Crombach, Sergio Peignier 외 1인·Machine Learning·발표 2025.11· 21 인용
최근 1년 21회 인용· 떠오르는 연구
한국어 핵심 요약
기계 학습 모델의 투명성은 해석 가능한 모델과 설명 가능한 결과를 촉진하는 중요한 비기능적 요구사항입니다. 그러나 선형, 규칙 기반, 의사결정나무와 같은 해석 가능한 분류 모델은 딥러닝이나 앙상블 방법론과 같은 더 정확하지만 복잡한 학습 패러다임에 의해 성능이 저해되는 경향이 있습니다. 특히 표 형식 데이터 분류에서는 랜덤 포레스트나 XGBoost 같은 트리 앙상블 기반 모델이 딥러닝 모델과 비교하여 여전히 경쟁력이 있으며 종종 선호되지만, 학습된 모델의 복잡성으로 인해 예측 설명 가능성 문제가 발생합니다.
기존 해결책은 특성 중요도 점수를 계산하거나 학습된 트리 앙상블에서 근사 대체 모델을 추출하는 방식이었으나, 이는 충실도가 낮거나 이해하기 어려운 대체 모델로 이어지는 한계가 있었습니다. 본 연구에서는 이러한 절충점을 개선하기 위해 Goodman-Kruskal의 연관성 측도를 활용하여 공유 특성 그룹으로 설명되는 예측을 가진 인스턴스 그룹을 찾습니다. 이 구조를 구축하기 위해 먼저 SHAP 값으로 인스턴스를 설명하여 지역 특성 중요도를 포착한 다음, 이 SHAP 값을 기반으로 특성과 함께 공동 군집화합니다.
이후, 각 인스턴스 그룹과 관련 특성 부분집합에 대해 학습된 얕은 의사결정나무 집합으로 대체 모델을 구축합니다. 실험 결과, 본 연구의 방법론은 최신 경쟁 방법론과 비교하여 경쟁력 있는 충실도와 더 높은 이해도를 가진 대체 모델을 생성하여 랜덤 포레스트 및 XGBoost 분류기를 효과적으로 설명함을 보여주었습니다.
본 연구는 복잡한 앙상블 모델의 설명 가능성을 향상시키는 새로운 접근 방식을 제시하며, 이를 통해 기계 학습 모델의 투명성을 높이고 실용적인 적용에 기여할 수 있을 것으로 기대됩니다.
섹션 미리보기
연구 배경
기계 학습 모델의 투명성은 중요한 요구사항이지만, 랜덤 포레스트나 XGBoost 같은 복잡한 앙상블 모델은 높은 정확도에도 불구하고 예측 과정이 불투명하여 설명 가능성 문제가 있습니다. 기존의 특성 중요도 계산이나 대체 모델 추출 방식은 충실도나 이해도 측면에서 한계가 있었습니다.
핵심 발견
본 연구는 SHAP 값을 기반으로 인스턴스와 특성을 공동 군집화하고, 이를 통해 각 그룹에 대해 얕은 의사결정나무 집합으로 대체 모델을 구축하는 새로운 방법을 제안합니다. 이 방법은 최신 기술 대비 경쟁력 있는 충실도와 높은 이해도를 제공하며, 복잡한 앙상블 모델의 예측을 효과적으로 설명합니다.
관련 컴퓨터 과학 논문
EDAFNet: 효율적 이중 주의 융합 HDR 재구성
2026·0
VR 활용 물리 학습이 디지털 역량에 미치는 영향
2026·0
다중 접속 엣지 컴퓨팅 환경의 실시간 통합 적응형 오프로딩
2026·0
주어진 버닝 넘버를 갖는 극단 트리
2026·0