다음 <보기>의 결과에 대한 진단과 대응으로 가장 적절한 것은?
보기
고객 이탈 예측에 의사결정나무를 적용한 결과이다.
| 설정 | 최대 깊이 | 학습 정확도 | 검증 정확도 |
|---|---|---|---|
| A | 제한 없음 | 1.00 | 0.71 |
| B | 5 | 0.86 | 0.83 |
| C | 2 | 0.74 | 0.73 |
또한 학습 데이터를 무작위로 90%만 뽑아 다시 학습할 때마다 최상위 분할 변수가 계속 바뀌는 현상이 관찰되었다.
- 1A는 잡음까지 학습한 과적합, C는 과소적합이므로 B 수준으로 조정하고, 최상위 분할이 바뀌는 불안정은 앙상블로 보완해야 한다.
- 2설정 A는 학습 정확도가 1.00이므로 데이터의 규칙을 완전히 학습한 것이며, 검증 정확도가 낮은 것은 검증 데이터의 크기가 작기 때문이다.
- 3최상위 분할 변수가 바뀌는 것은 데이터에 오류가 있다는 뜻이므로, 해당 변수들을 모두 제거한 뒤 남은 변수로만 다시 학습해야 한다.
- 4깊이를 제한할수록 검증 정확도가 항상 높아지므로 설정 C가 가장 적절하며, 깊이를 1로 더 줄이면 성능이 더 개선된다.
꿈라CBT