랜덤 포레스트에서 결측치를 처리하는 MIA 기법의 실용적 적용
결측 데이터와 트리 기반 모델의 도전 과제
현실 세계의 데이터셋에서는 거의 언제나 일부 값이 누락되는 경우가 발생한다. 특히 고차원일수록, 혹은 관측이 복잡할수록 결측 확률은 증가한다. 전통적으로 결측치는 평균 대치, 회귀 대치, 또는 완전한 사례만 사용함으로써 처리되곤 한다. 그러나 이러한 방법들은 편향을 유발하거나 분산을 과대추정할 수 있으며, 이론적 ...
7월 27일 23:58에 게시됨