빅데이터분석기사 필기 · 11회 변형(엑셀) · 어려움 난이도 · 41번

Q.41202511어려움 변형빅데이터 모델링

다음 <보기>의 결과에 대한 진단으로 가장 적절한 것은?

보기

고객 이탈을 예측하는 의사결정나무를 정보이득 기준으로 학습시켰다.

  • 모델은 고객ID(모든 값이 서로 다름)를 최상위 분할 변수로 선택했다.
  • 이 분할로 만들어진 자식 노드들은 엔트로피가 모두 0이었다.
  • 학습 정확도는 100%였으나 검증 정확도는 무작위 수준이었다.
  • 1정보이득은 범주가 많은 변수에 유리해 생긴 편향이므로, 이득비율을 쓰고 ID를 제외해야 한다.
  • 2자식 노드의 엔트로피가 0이므로 완벽한 분할이며, 검증 정확도가 낮은 것은 검증 데이터의 오류이다.
  • 3정보이득 대신 엔트로피 자체를 최대화하는 기준으로 바꾸면 이 문제가 해결된다.
  • 4고객ID는 수치형 변수이므로 정규화를 적용하면 분할 변수로 선택되지 않는다.

정답: 1 · 정보이득은 범주가 많은 변수에 유리해 생긴 편향이므로, 이득비율을 쓰고 ID를 제외해야 한다.

해설
해설 불러오는 중…
이 회차 문제 풀어보기 →빅데이터분석기사 필기 더 풀기