빅데이터분석기사 필기 · 10회 변형(엑셀) · 어려움 난이도 · 48번

Q.48202510어려움 변형빅데이터 모델링

다음 <보기>의 결과에 대한 진단과 대응으로 가장 적절한 것은?

보기

고객 이탈 예측에 의사결정나무를 적용한 결과이다.

설정최대 깊이학습 정확도검증 정확도
A제한 없음1.000.71
B50.860.83
C20.740.73

또한 학습 데이터를 무작위로 90%만 뽑아 다시 학습할 때마다 최상위 분할 변수가 계속 바뀌는 현상이 관찰되었다.

  • 1A는 잡음까지 학습한 과적합, C는 과소적합이므로 B 수준으로 조정하고, 최상위 분할이 바뀌는 불안정은 앙상블로 보완해야 한다.
  • 2설정 A는 학습 정확도가 1.00이므로 데이터의 규칙을 완전히 학습한 것이며, 검증 정확도가 낮은 것은 검증 데이터의 크기가 작기 때문이다.
  • 3최상위 분할 변수가 바뀌는 것은 데이터에 오류가 있다는 뜻이므로, 해당 변수들을 모두 제거한 뒤 남은 변수로만 다시 학습해야 한다.
  • 4깊이를 제한할수록 검증 정확도가 항상 높아지므로 설정 C가 가장 적절하며, 깊이를 1로 더 줄이면 성능이 더 개선된다.

정답: 1 · A는 잡음까지 학습한 과적합, C는 과소적합이므로 B 수준으로 조정하고, 최상위 분할이 바뀌는 불안정은 앙상블로 보완해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기