다음 <보기>의 절차에 대한 지적으로 가장 적절한 것은?
보기
분석가는 고객 이탈 예측 모형을 만들며 다음 순서로 작업하였다.
- 전체 데이터 5만 건을 대상으로 결측치를 전체 평균으로 대체하였다.
- 전체 데이터로 표준화(평균 0, 표준편차 1)를 수행하였다.
- 전체 데이터의 사분위수를 기준으로 이상치를 찾아 제거하였다.
- 그 결과를 학습 7 : 검증 3으로 분할하였다.
- 검증 데이터에서 AUC 0.93을 얻어 성능이 우수하다고 보고하였다.
그러나 실제 서비스에 배포하자 성능이 크게 하락하였다.
- 1결측치를 평균으로 대체한 것이 유일한 문제이므로, 대체 방법만 중앙값으로 바꾸면 배포 후 성능 하락은 해소된다.
- 2분할 전에 전체 데이터로 통계량을 계산해 검증 정보가 흘러든 데이터 누수이므로, 통계량은 학습 데이터에서만 산출해야 한다.
- 3이상치를 제거한 뒤 분할했기 때문에 검증 데이터의 크기가 줄어든 것이 원인이므로, 분할 비율을 5 : 5로 조정하면 해결된다.
- 4AUC 0.93은 과대적합의 징후이므로 전처리 절차는 그대로 두고 모델을 더 단순한 알고리즘으로 교체해야 한다.
꿈라CBT