p-값 합산을 통한 회귀 트리 정규화
Regularisation of regression trees by summation of p values
Nils Engler, Mathias Lindholm, Filip Lindskog 외 1인·Computational Statistics·발표 2026.09· 0 인용
한국어 핵심 요약
CART 회귀 트리의 복잡도를 결정하는 표준 방식은 교차 검증을 통해 미지의 데이터에 잘 일반화되는 예측 모델을 얻는 것입니다. 그러나 폴드 선택의 무작위성은 최종 트리 모델을 비결정론적으로 만들고, 교차 검증 절차는 시간이 오래 걸리며 훈련 데이터의 비효율적인 사용으로 이어질 수 있습니다.
본 연구는 노드별 통계 테스트를 기반으로 CART 회귀 트리의 성장을 멈추는 간단하고 결정론적인 인샘플(in-sample) 방법을 제안합니다. 이 테스트 절차는 변화점 탐지(change point detection)와의 연관성을 통해 도출되었으며, 귀무 가설은 '신호 없음'에 해당합니다. 제안된 p-값 기반 절차는 임의 차원의 공변량 벡터를 고려할 수 있으며, 전체 트리의 p-값 상한을 설정할 수 있게 합니다.
또한, 충분히 큰 표본 크기가 주어지면 이 테스트가 약하지 않은 신호를 높은 확률로 감지함을 보였습니다. 우리는 시뮬레이션 데이터와 실제 데이터를 통해 본 방법론과 점근적 결과를 입증합니다. 추가적으로, p-값 기반 방법이 주어진 블랙박스 예측 모델을 기반으로 결정론적인 조각별 상수 자동 보정 예측 모델을 구성하는 데 어떻게 사용될 수 있는지 보여줍니다.
이 연구는 회귀 트리의 복잡도 제어에 있어 기존 교차 검증의 한계를 극복하고, 보다 효율적이고 결정론적인 대안을 제시함으로써 모델의 신뢰성과 해석 가능성을 높이는 데 기여합니다.
섹션 미리보기
연구 배경
CART 회귀 트리의 복잡도 결정에 사용되는 교차 검증은 비결정론적이며, 시간 소모적이고 훈련 데이터 활용에 비효율적일 수 있습니다. 이는 모델의 재현성과 효율성에 문제를 야기합니다.
핵심 발견
우리는 노드별 통계 테스트에 기반한 결정론적 인샘플 방법을 제안합니다. 이 p-값 기반 절차는 임의 차원의 공변량을 처리하며, 전체 트리의 p-값 상한을 설정하고, 충분한 샘플 크기에서 신호를 높은 확률로 감지합니다.
관련 컴퓨터 과학 논문
VR 인지 선별 도구 Cogniclear의 유효성 예비 검증
2026·0
카오스 기반 프로토넷: 소량 의료 영상 분류
2026·0
동적 양자 회로 자동 컴파일 프레임워크
2026·0
DeMa: 시차 인지 맘바 기반 다변량 시계열 분석
2026·0