ADsP · 48회 변형(엑셀) · 어려움 난이도 · 39번

Q.39202648어려움 변형3과목 · 데이터 분석
아래는 어느 분석가가 고객 이탈 예측 모델을 구축한 절차이다. 이 절차에 대한 지적으로 가장 적절하지 않은 것은?
보기

① 전체 데이터 10,000건의 결측치를 전체 평균으로 대체하고, 전체 데이터의 평균·표준편차를 이용하여 모든 변수를 표준화하였다.
② 이탈(1) 비율이 3%로 매우 낮아, 전체 데이터에 대해 오버샘플링(SMOTE)을 수행하여 이탈 비율을 50%로 맞추었다.
③ ②의 결과를 훈련 7 : 평가 3으로 무작위 분할하였다.
④ 훈련 데이터로 모델을 학습한 뒤 평가 데이터에서 정확도 96%를 얻어, 실제 서비스에서도 96% 수준의 성능이 나올 것이라고 결론지었다.

  • 1①에서 전체 데이터의 평균·표준편차로 표준화하면 평가 데이터의 정보가 훈련 과정에 스며드는 데이터 누수(data leakage)가 발생한다.
  • 2②에서 분할 이전에 오버샘플링을 수행하면 같은 원자료로부터 만들어진 합성 표본이 훈련과 평가에 나뉘어 들어가, 평가 성능이 낙관적으로 부풀려진다.
  • 3④에서 클래스 비율이 인위적으로 50%로 바뀐 평가 데이터의 정확도는, 실제 이탈률 3%인 운영 환경의 성능을 대표하지 못한다.
  • 4③에서 훈련과 평가를 7:3으로 나눈 것이 이 절차의 가장 근본적인 오류이며, 표본이 10,000건이라면 반드시 5:5로 분할해야 한다.

정답: 4 · ③에서 훈련과 평가를 7:3으로 나눈 것이 이 절차의 가장 근본적인 오류이며, 표본이 10,000건이라면 반드시 5:5로 분할해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →ADsP 더 풀기