K-겹 교차 검증, 최적의 모델 선택법인가?
Is K-fold cross validation the best model selection method for machine learning?
J. M. Górriz, R. Martin-Clemente, F. Segovia 외 3인·Information Fusion·발표 2026.04· 37 인용
최근 1년 32회 인용· 떠오르는 연구
한국어 핵심 요약
기계 학습은 복잡한 패턴을 효과적으로 표현하며, 다중 소스 및 이종 정보 융합 시나리오에서 예측 추론에 큰 잠재력을 가집니다. K-겹 교차 검증(CV)은 기계 학습 결과가 우연에 의해 생성될 가능성을 평가하는 가장 일반적인 접근 방식이며, 종종 기존 가설 검정보다 우수한 성능을 보입니다. 이는 정확도와 같이 모수적 설명이 없는 기계 학습 분류에서 직접 얻은 측정치에서 비롯됩니다.
융합 지향 기계 학습 파이프라인 내에서 빈도주의적 분석에 접근하기 위해, 순열 검정 또는 데이터 분할(즉, 폴드)의 간단한 통계를 추가하여 신뢰 구간을 추정할 수 있습니다. 그러나 모수적 또는 비모수적 검정 모두 작은 표본 크기 데이터셋 분할 및 이종 융합 데이터 소스 학습의 내재된 문제를 해결하지 못합니다. 기계 학습이 학습 매개변수와 폴드 전반의 데이터 분포에 크게 의존한다는 사실은 과도한 위양성, 불확실성 전파 및 재현성 문제와 같은 익숙한 어려움을 야기합니다.
본 연구는 K-겹 CV와 실제 위험의 상한(K-fold CUBV)에 기반한 새로운 통계 검정을 제안합니다. 이는 농도 부등식 평가를 통해 CV를 사용한 기계 학습의 불확실한 예측을 최악의 경우로 제한합니다. K-겹 CV와 결합된 선형 분류기를 위한 PAC-베이즈 상한이 도출되어 실제 위험을 추정하는 데 사용됩니다.
또한, 작은 표본 크기, 적은 예측 변수, 다중 소스 데이터 이질성을 포함한 일반적인 실험 상황을 모델링하고 시뮬레이션하여 재현성 문제의 원인을 밝힙니다. 시뮬레이션 및 신경 영상 데이터셋을 통한 성능 평가는 K-fold CUBV가 기계 학습에서 얻은 효과 및 정확도 값을 감지하고 검증하는 데 강력한 절차임을 시사합니다.
섹션 미리보기
연구 배경
기계 학습은 다중 소스 정보 융합 시나리오에서 예측 추론에 큰 잠재력을 가집니다. K-겹 교차 검증(CV)은 기계 학습 결과의 우연성을 평가하는 일반적인 방법이지만, 작은 표본 크기 및 이종 데이터 문제에 한계가 있습니다.
핵심 발견
본 연구는 K-겹 CV와 실제 위험의 상한(K-fold CUBV)에 기반한 새로운 통계 검정을 제안합니다. 이는 기계 학습 예측의 불확실성을 최악의 경우로 제한하며, 재현성 문제의 원인을 규명하고 K-fold CUBV가 기계 학습 정확도 검증에 강력함을 입증합니다.
관련 컴퓨터 과학 논문
부분 관측 다중 모드 헬스케어 예측을 위한 차등 프라이빗 연합 학습
2026·0
미주신경성 실신 탐지: 프라이버시 보호 ML
2026·0
AI 생성 대화의 자연스러움: 턴 주고받기 및 역할 행동 분석
2026·0
해양 공간 데이터 인프라와 오픈 사이언스 연계
2026·0